Spraak naar tekst is het automatisch omzetten van gesproken woord in geschreven tekst. Je uploadt of streamt audio, er komt een transcript uit. Dat werkt inmiddels goed genoeg om er echt op te leunen.
De vraag die vrijwel nooit wordt gesteld: waar gaat die opname naartoe voordat het transcript terugkomt?
Bij bijna elke gratis dienst is het antwoord: naar een server die jij nooit hebt beoordeeld, in een land dat je niet hebt gekozen, onder voorwaarden die je hebt weggeklikt. Voor een spraakmemo over de boodschappen is dat prima. Voor een klantgesprek is dat een andere afweging, en die maakt vrijwel niemand bewust.
Wat er technisch gebeurt
De keten is bij elke clouddienst hetzelfde.
- Je audio wordt opgenomen en meestal gecomprimeerd.
- Het bestand of de stream gaat over het internet naar de server van de aanbieder.
- Daar draait een spraakherkenningsmodel dat de audio omzet in tekst.
- Het transcript komt terug.
Stap 2 is de hele discussie. Vanaf dat moment ligt je opname op infrastructuur waar jij geen zeggenschap over hebt, en gelden de voorwaarden van de aanbieder over hoe lang hij hem bewaart en waar hij hem voor gebruikt.
Bij betaalde zakelijke abonnementen staat vaak dat je audio niet wordt gebruikt om modellen te trainen. Bij gratis diensten staat dat er vaak juist niet. Dat verschil is niet toevallig: bij een gratis dienst betaal je met iets anders.

Waarom dat bij een klantgesprek uitmaakt
Een klantgesprek is geen neutrale audio. Er zit vrijwel altijd iets in van het volgende:
- Namen en functies van mensen bij die klant
- Wat ze bij hun huidige leverancier niet bevalt
- Bedragen, marges, budgetten
- Interne problemen die ze je in vertrouwen vertellen
- Soms gezondheids- of personeelsinformatie
Als je dat bij elkaar optelt: je stuurt de vertrouwelijke bedrijfsvoering van een ander bedrijf naar een derde partij, meestal zonder dat die klant het weet en zonder dat je het in je verwerkersregister hebt staan.
Onder de AVG ben je verwerkingsverantwoordelijke voor de persoonsgegevens in die opname. De transcriptiedienst is dan je verwerker, en daar hoort een verwerkersovereenkomst bij. Bij een gratis account op een consumentendienst heb je die niet.
Dat is geen theoretisch punt. Het is de vraag die je krijgt op het moment dat een klant vraagt hoe je zijn gegevens behandelt, en bij aanbestedingen staat hij inmiddels standaard in de uitvraag.
Het alternatief: de opname blijft op je machine
Spraakherkenning die lokaal draait bestaat en is de laatste twee jaar bruikbaar geworden. Het model staat op je eigen computer, de audio gaat er nooit vanaf, en er is geen stap 2.
Ik draai dit zelf voor elk klantgesprek dat ik uitwerk. De opzet is niet ingewikkeld:
- Het model: Whisper large-v3-turbo, het open spraakherkenningsmodel van OpenAI, dat je lokaal kunt draaien zonder verbinding met hun servers.
- De machine: een Mac met Apple Silicon. Op mijn setup draait het via mlx-whisper, dat gebruikmaakt van de grafische chip.
- Extra: herkenning van wie wanneer spreekt, en een stap die namen en bedrijfsnamen automatisch vervangt door pseudoniemen voordat ik het transcript verder verwerk.
Die laatste stap is degene die ik het vaakst uitleg en het minst kan missen. Als ik een transcript daarna door een taalmodel haal om er een samenvatting van te maken, gaan de echte namen daar niet in mee. De sleuteltabel blijft lokaal.
Belangrijk over het platform. Deze opzet is macOS met Apple Silicon. Op Windows en Linux kan lokale transcriptie ook, via whisper.cpp of een vergelijkbare implementatie, maar de installatie is bewerkelijker en de snelheid hangt sterker af van je videokaart. Als je op Windows werkt en dit wilt proberen, reken op een middag uitzoekwerk in plaats van een half uur.
Wat lokaal kost aan snelheid
Hier moet ik eerlijk zijn, want dit is de reële grens.
Lokaal draaien is langzamer. Ik heb het gemeten op mijn eigen machine met hetzelfde model en dezelfde audio:
- Lokaal, Whisper large-v3-turbo: mediaan 990 milliseconden per fragment
- Dezelfde audio via een cloudversneller: 209 milliseconden, ongeveer vijf keer sneller, voor ongeveer een halve cent per keer
Ik heb geprobeerd dat gat te dichten met meer rekenkracht: van vier naar acht processorthreads. Resultaat: 986 milliseconden. Vrijwel geen verschil. De beperking zit niet in hoe je het verdeelt, maar in de rauwe rekencapaciteit.
Voor het uitwerken van een opname achteraf maakt die factor vijf niets uit. Een gesprek van een uur is lokaal in een paar minuten klaar en dat is snel genoeg.
Voor iets dat tijdens een gesprek moet meelopen, is het wél het verschil. Daar bijt lokaal privacy tegen soepelheid, en dat is een echte afweging en geen detail.
Wanneer je wat kiest
Het is geen principiële keuze. Het is een keuze per soort opname.
Lokaal, zonder discussie:
- Klantgesprekken en verkoopgesprekken
- Sollicitatie- en functioneringsgesprekken
- Alles met medische, financiële of juridische inhoud
- Elk gesprek waarin een derde partij vertrouwelijke informatie deelt
Cloud is prima:
- Je eigen spraakmemo's en losse aantekeningen
- Publieke opnames: een webinar, een podcast, een presentatie die toch al openbaar is
- Alles waarvan je de tekst binnen een week zelf publiceert
Het grijze gebied: interne vergaderingen. Formeel zit er personeelsinformatie in, praktisch is het risico laag. Mijn eigen regel: interne overleggen waar personen worden besproken gaan lokaal, de rest niet.
Wat je in elk geval doet, ongeacht je keuze: leg vast welke dienst je waarvoor gebruikt en wat er in de voorwaarden staat over bewaartermijn en modeltraining. Dat is één regel per dienst in je AI-register en het is precies wat je nodig hebt op het moment dat er iemand naar vraagt.
Lees ook: AI en AVG: wat mag wel en wat niet als je AI inzet
Waarom ik dit zelf ben gaan bouwen
Ik wilde coaching tijdens een verkoopgesprek, niet erna. En ik wilde dat mijn klantdata op mijn machine bleef. Er was geen tool die allebei deed.
Dat is OnCue geworden: een sales copilot die live meeluistert, volledig lokaal transcribeert en de code openlegt. De transcriptie is daarin de zwaarste vaste kost van de hele keten, zwaarder dan het genereren van tekst. Dat was het eerste wat me verraste toen ik ging meten.
Het is open source, dus je hoeft mijn woord er niet voor aan te nemen: je kunt in de code zien welk stuk waar draait en welke gegevens wanneer de machine verlaten.
Veelgestelde vragen
Wat je nu kunt doen
Kijk in de voorwaarden van de transcriptiedienst die je nu gebruikt en zoek twee dingen op: hoe lang bewaren ze je audio, en gebruiken ze hem om modellen te trainen. Dat kost tien minuten en het antwoord bepaalt of je huidige werkwijze houdbaar is voor klantgesprekken.
Werk je op een Mac met Apple Silicon en wil je het lokaal proberen, dan is Whisper large-v3-turbo via mlx-whisper het kortste pad. Een uur opname is in een paar minuten uitgewerkt en er gaat niets de deur uit.
Bouw ik iets waar je nieuwsgierig naar bent? OnCue is de live-variant hiervan, en die staat op de wachtlijst-pagina. De code is open: github.com/Vinix24/OnCue.