"Tot 400 keer goedkoper dan een taalmodel." Dat was half september de kop boven elk bericht over Jev, het nieuwe model van TypeSafe AI.
Het getal komt uit hun eigen metingen. Alleen vertelt niemand erbij waar het tegen gemeten is. Ik rekende het door voor mijn eigen systemen en kwam uit op 32 keer. Goed voor 147 dollar per jaar.
Wat Jev is
Jev schrijft geen tekst. Je stelt het een gesloten vraag, zoals "welke categorie is dit" of "ja of nee". Je krijgt een antwoord met een kans erbij.
Dat maakt het goedkoop. Je betaalt 0,042 dollar per miljoen tokens invoer (stukjes tekst van een paar letters) en niets voor het antwoord.
TypeSafe claimt in eigen tests tot ruim 400 keer lagere kosten dan een groot taalmodel.
Ik rekende het door voor mijn eigen systemen
Mijn cockpit, het systeem waarin ik mijn eigen bedrijf bestuur, deed in 28 dagen 4.512 kleine modelaanroepen. Kosten: 11,64 dollar. Met Jev zou dat 0,36 dollar zijn.
Dat is 32 keer goedkoper. Over een jaar scheelt het 147 dollar.
Bij mijn andere systemen bleef de besparing hooguit een paar honderd dollar per jaar. Vaak was het nul:
- Mijn verkoopassistent handelt 87,2% van het werk al af met vaste triggers en een lokale betekenisvergelijking, voordat het taalmodel eraan te pas komt. Die eerste laag draait lokaal, waar een model in de cloud per definitie niet kan komen.
- Mijn SEO-tool zou met Jev een veld vervangen en geen aanroep. De dure stap blijft staan. Het wordt eerder duurder.
- Een klantproject filtert het meeste al weg met vaste regels, gratis. Bijna de helft van wat het model daarna teruggeeft is vrije tekst die de klant leest. Die kan Jev niet schrijven. De factor ligt daar hoger. Het bedrag blijft klein, op een systeem dat nog niet in productie draait.
In vier van de vier systemen stond er al een gratis laag vóór het model.
Waarom de 400 keer misleidt
De 400 keer is gemeten tegen een groot taalmodel dat elke beslissing zelf neemt.
Zo bouwt bijna niemand meer die al een tijdje met AI werkt. Wie de kosten ooit zag oplopen, heeft allang vaste regels en goedkope modellen vóór het dure model gezet.
De dure laag was er bij mij al uit.
Het werkelijke vergelijk is dus: Jev tegen het kleine, goedkope model dat je nu al gebruikt. Bij mijn cockpit blijft er dan een factor 32 over, op een bedrag dat al klein was.
De kosten die niet in de rekensom staan
147 dollar per jaar is een afrondingsfout. Daar staat iets tegenover dat wel geld kost.
Een extra leverancier, met een eigen contract en een eigen storing. Een sleutel die verloopt: bij mij liepen twee werksessies vast op een oude kopie van een API-sleutel die nog in de omgeving rondhing.
En een koppeling die je moet onderhouden als de leverancier iets verandert.
Dat is onderhoud kopen met geld dat je niet bespaart.
Een kans is geen reden
Er zit nog een tweede probleem in. Dat weegt voor mij zwaarder dan de kosten.
Jev geeft een getal terug, geen uitleg. In mijn eigen test deelde het code-bevindingen goed in: 88,5% goed tegen 63,9% voor mijn vaste regels.
Dat is gemeten op één van de vijf soorten, de makkelijkste. En in de groep waar het gemiddeld 99,85% zeker was, zat nog steeds ongeveer één op de zestien fout.
Een lage score waarschuwt wel. Aan een hoge score zie je niet welke antwoorden fout zijn. Dat uitzoeken is het dure deel.
Waar een klant een score te zien krijgt, heb je een zin uit de bron nodig die laat zien waarom. Een 0,73 zonder die zin is voor de klant een verslechtering, ook als het getal klopt.
Lees ook: Wat kost AI-implementatie echt?: waar het geld in een AI-project werkelijk naartoe gaat
Waar Jev wel iets toevoegt
Het nut zit in kwaliteit. Daar vond ik twee plekken.
Een gesloten indeling met een heldere definitie. Code-bevindingen sorteren in vijf soorten ging duidelijk beter dan met trefwoorden, voor twee cent in totaal.
Varianten vinden die je eigen regels missen. Ik liet Jev zoeken naar schrijftics die mijn vaste controle niet herkende.
Het vond drie patronen die ik daarna als vaste regel toevoegde. Die vangen nu 92 extra gevallen in mijn gepubliceerde teksten.
Let op wat daar gebeurde. Jev besliste niet wat fout was. Het wees aan welke regel ik moest bouwen. Die regel doet daarna het werk.
Dat is de grens die ik aanhoud. Een beslismodel mag kiezen welk gereedschap er komt. Nooit wat het gereedschap vindt.
De vraag die ik nu stel
Bij elke "zoveel keer goedkoper" stel ik één vraag: goedkoper dan wat?
Is het antwoord "dan een groot model dat alles zelf beslist"? Dan hoort het getal niet bij jouw situatie. Kijk dan eerst wat je nu al betaalt en wat daar al gratis wordt afgevangen.
Drie vragen die ik mezelf stel voordat ik een goedkoper model inbouw:
- Wat kost de stap die ik wil vervangen nu echt per maand? Niet per aanroep, per maand. Bij mij was het antwoord 11,64 dollar.
- Wordt dat werk al deels gratis gedaan? Door vaste regels, een zoeklaag of een filter vooraf. Dan vervang je alleen de rest.
- Leest iemand het antwoord, of alleen het systeem? Leest een mens het? Die heeft een reden nodig en geen kans.
Zijn de eerste twee antwoorden klein? Dan is de besparing het niet waard. Dan is de vraag alleen nog of het model iets beter maakt.
Het volledige onderzoek, met de cijfers en de herkansingen, staat in het Engels in Jev vs Layaen het vervolgJev vs 25 lines of Python.
Hoe ik AI-systemen controleerbaar houd, lees je op mijn pagina over AI-governance.