Spraak naar tekst Nederlands gratis draaien kan, volledig op je eigen machine. Het werkt goed genoeg om op te leunen, en minder goed dan het Engels. Dat verschil is geen gevoel: het zit in hoe deze modellen zijn getraind, en het is te zien in de benchmarkcijfers.
Whisper large-v3, het model dat vrijwel elke gratis en betaalde dienst onder water gebruikt, zit over alle ondersteunde talen gemiddeld rond de 10% woordfoutmarge. Op Engels presteert het aanzienlijk beter dan dat gemiddelde. Nederlands zit daar niet aan de slechte kant van, maar haalt het Engelse niveau ook niet. Het precieze cijfer verschilt sterk per benchmark, dus hang er geen doelstelling aan op.
Wat je daarvan merkt is niet dat het transcript onbruikbaar is. Wat je merkt is dat het vloeiend leest en op specifieke plekken fout is. Dat is de lastigste soort fout, want je ziet hem niet zonder na te kijken.
Waar de fouten zitten
Uit mijn eigen transcripten van klantgesprekken, in volgorde van frequentie.
Eigennamen. Bedrijfsnamen, achternamen, productnamen. Het model kent ze niet en gokt op iets dat fonetisch dichtbij ligt. Een klant die "Renewance" heet wordt "Renewents", en dat blijft consequent fout in het hele transcript.
Vakjargon. Elke branche heeft woorden die in de trainingsdata nauwelijks voorkomen. In de bouw, de zorg en de financiële sector zijn de eerste tien minuten van elk transcript daarom het meest bewerkelijk: daar vallen de termen die de rest van het gesprek dragen.
Getallen. "Vijfentwintighonderd" wordt "25 100" of "2510". Bedragen en aantallen zijn precies de dingen waar een fout iets kost, en precies waar Nederlands lastiger is dan Engels omdat de getalvolgorde omgekeerd is: wij zeggen eenentwintig, het Engels zegt twenty-one.
Engels in Nederlandse zinnen. Dit is de grootste. Wij praten zakelijk in een mengvorm: "we hebben de deployment gedaan maar de pipeline stond nog op staging". Whisper bepaalt de taal op een groter audioblok en niet per zin. Kiest hij Nederlands, dan worden de Engelse termen fonetisch vernederlandst. Kiest hij Engels, dan is de rest van het transcript slechter.

Wat dat betekent voor je werkwijze
Eén regel maakt het verschil: behandel een transcript als een ruwe versie, niet als een bron.
Concreet:
- Trek geen cijfers uit een transcript zonder ze in de opname terug te luisteren
- Neem geen citaat over zonder de bijbehorende passage te controleren
- Laat geen taalmodel een samenvatting maken van een ongecontroleerd transcript als er beslissingen op volgen
Dat laatste is de fout die ik het vaakst zie. Iemand transcribeert een gesprek, laat er een AI een samenvatting van maken, en gebruikt die samenvatting als geheugen van wat er is afgesproken. De transcriptiefout is dan twee lagen diep begraven en niemand komt er nog achter.
Wat wél goed werkt: het transcript gebruiken om snel terug te vinden waar iets werd gezegd, en dan die passage beluisteren. Dat is de opbrengst en die is groot genoeg.
Spraak naar tekst Nederlands gratis draaien
Gratis betekent hier: geen abonnement en geen prijs per minuut. Het model is open, je draait het op je eigen machine.
Op een Mac met Apple Silicon. Installeer mlx-whisper, haal het model large-v3-turbo op, en geef expliciet de taal mee. Dat laatste is belangrijk: laat je de taaldetectie het zelf bepalen, dan kan hij bij een gemengd gesprek voor Engels kiezen.
Op Windows of Linux. Gebruik whisper.cpp. Werkt goed, kost meer uitzoekwerk, en de snelheid hangt af van je videokaart. Zonder aparte videokaart draait het wel, maar dan reken je in kwartieren per opname.
Wat je moet weten over "gratis" online. De gratis webdiensten die Nederlandse transcriptie aanbieden, draaien vrijwel allemaal hetzelfde open model. Je krijgt dus dezelfde kwaliteit, met één verschil: je audio gaat naar hun server. Bij een gratis account staat in de voorwaarden vaak dat ze die mogen gebruiken om hun dienst te verbeteren. Voor een klantgesprek is dat de reden om het lokaal te doen, niet de kwaliteit.
Twee instellingen die echt schelen
Geef de taal expliciet op. Zet hem op nl als het gesprek overwegend Nederlands is. Loopt er veel Engels doorheen en domineert dat, zet hem dan op en. Bij een echt half-om-half gesprek: knip de opname per spreker of per blok en draai die apart. Dat is omslachtig en het is de enige manier die werkt.
Gebruik het turbo-model, niet de volledige versie. Whisper large-v3-turbo is aanzienlijk sneller dan large-v3 met nauwelijks kwaliteitsverlies op gewone gesproken tekst. Ik heb op mijn eigen machine gemeten dat lokaal ongeveer vijf keer langzamer is dan een cloudversneller met hetzelfde model (990 tegen 209 milliseconden per fragment). Voor werk achteraf is dat ruim voldoende, en met het turbo-model blijft een uur opname in een paar minuten klaar.
Wat niet helpt: meer processorthreads. Ik ging van vier naar acht en kwam uit op 986 in plaats van 990 milliseconden. De beperking zit in rekencapaciteit, niet in de verdeling.
Wat je met de eigennamen doet
Dit is het probleem waar de meeste tijd in gaat, en er is een simpele oplossing die niemand gebruikt.
Maak één keer een lijst van de namen die in jouw gesprekken steeds terugkomen: je eigen bedrijfsnaam, je productnamen, de vaste klanten, de branchetermen. Draai na elke transcriptie een zoek-en-vervang over die lijst met de fonetische varianten die het model ervan maakt.
Na drie gesprekken weet je welke varianten het model kiest, want die zijn consistent. Vanaf dat moment is het een bestand dat je bijhoudt in plaats van werk dat je elke keer opnieuw doet.
Dat kost twintig minuten om op te zetten en het haalt de helft van de nabewerking weg.
Veelgestelde vragen
Het eerlijke antwoord
Nederlandse transcriptie is goed genoeg om je een uur werk te besparen per gesprek, en niet goed genoeg om er zonder controle beslissingen op te baseren. Dat is een nuttige tool, geen bron van waarheid.
Draai het lokaal als er klantinformatie in zit. Houd een vervanglijst bij voor de namen. En luister terug voordat je een cijfer overneemt.
Wil je meedenken of meekijken bij de live-variant, dan staat de wachtlijst op /oncue.
Ik heb dezelfde afweging gemaakt bij het bouwen van een sales copilot die tijdens een gesprek meeluistert. De transcriptie bleek de zwaarste vaste kost van de hele keten, zwaarder dan het genereren van tekst. De code is open: github.com/Vinix24/OnCue. Draait op macOS met Apple Silicon; Windows staat nog op de lijst.