Spraak omzetten naar tekst kan volledig op je eigen computer. Geen abonnement, geen prijs per minuut, en je audio verlaat de machine niet. De modellen die dat mogelijk maken zijn open en gratis.
Wat het kost is hardware en een middag installeren. Wat je ervoor terugkrijgt is een werkwijze die niet stukgaat als een aanbieder zijn prijzen verdubbelt of zijn voorwaarden verandert.
Hieronder staat hoe het werkt, wat je nodig hebt, en waar het tekortschiet.
Wat je nodig hebt
Drie dingen.
Een model. Whisper large-v3-turbo is op dit moment de praktische keuze: open, meertalig, en de turbo-variant is aanzienlijk sneller dan de volledige versie met nauwelijks kwaliteitsverlies voor gewone gesproken tekst. Je downloadt hem één keer, daarna werkt het zonder verbinding.
Een machine die het aankan. Op een Mac met Apple Silicon draait het via mlx-whisper, dat de grafische chip gebruikt. Op Windows of Linux gebruik je whisper.cpp, en dan bepaalt je videokaart de snelheid. Op een gemiddelde kantoorlaptop zonder aparte videokaart werkt het wel, maar dan reken je in kwartieren in plaats van minuten.
Audio in een bruikbaar formaat. Vrijwel alles wordt geaccepteerd (m4a, wav, mp3), meestal via een conversiestap onder water. Wat je wilt vermijden is een opname met veel achtergrondgeluid of mensen die door elkaar praten, want daar loopt elk model op stuk.

De twee dingen die je erbij wilt
Een kaal transcript is een muur tekst. Twee toevoegingen maken het bruikbaar.
Sprekerherkenning. Wie zegt wat. Technisch heet dat diarization, en het is een tweede model dat over de audio heen kijkt en bepaalt op welke momenten wie aan het woord is. Je krijgt er labels bij: spreker 1, spreker 2. Die koppel je achteraf zelf aan namen, want het model weet niet wie wie is.
Bij een gesprek van twee personen werkt dit goed. Bij vier mensen aan een vergadertafel met overlap wordt het merkbaar slechter, en dan is handmatig nabewerken sneller dan het model bijstellen.
Anonimiseren. Een stap die namen, bedrijfsnamen en andere herleidbare gegevens vervangt door pseudoniemen, met een sleuteltabel die lokaal blijft. Dat gebruik ik zelf altijd voordat ik een transcript verder verwerk met een taalmodel: de analyse gebeurt op de geanonimiseerde versie, de echte namen blijven op mijn machine.
Die volgorde is het hele punt. Anonimiseer vóór de verwerking, niet erna. Anders heb je de gegevens al gedeeld en poets je achteraf alleen het bewijs weg.
Wat het je kost
In geld: niets, na de hardware. Het model is gratis, er is geen abonnement en geen prijs per minuut.
In tijd, eenmalig: op een Mac met Apple Silicon een half uur tot een uur installeren. Op Windows reken op een middag, omdat de afhankelijkheden rommeliger zijn en je vaker iets moet uitzoeken.
In tijd, per opname: hier zit het echte verschil met de cloud.
Ik heb dat op mijn eigen machine gemeten met hetzelfde model en dezelfde audio:
| Waar | Mediaan per fragment |
|---|---|
| Lokaal (Whisper large-v3-turbo) | 990 milliseconden |
| Lokaal, met 8 threads in plaats van 4 | 986 milliseconden |
| Via een cloudversneller, zelfde model | 209 milliseconden |
Dus ongeveer vijf keer langzamer. En de middelste rij is het interessantst: meer processorthreads leverden vrijwel niets op. De beperking zit niet in hoe je het werk verdeelt, maar in rauwe rekencapaciteit. Wie denkt dat te compenseren met instellingen, kan die middag beter besparen.
Praktisch vertaald: een gesprek van een uur is lokaal in een paar minuten uitgewerkt. Voor werk achteraf is dat ruim snel genoeg.
Waar lokaal tekortschiet
Vier dingen, en ik noem ze omdat ik ze zelf tegenkwam.
Live meelopen. Voor iets dat tijdens een gesprek moet meedraaien, is die factor vijf wél het verschil. Daar bijt privacy tegen soepelheid en is er geen truc die het oplost.
Slechte audio. Telefoongesprekken, opnames vanaf de andere kant van een vergaderzaal, veel achtergrondgeluid. Cloudaanbieders hebben hier soms extra voorbewerking in hun keten zitten die je lokaal niet standaard hebt.
Meerdere talen door elkaar. Whisper detecteert de taal op een groter audioblok, niet per zin. Bij een gesprek waarin Nederlands en Engels door elkaar lopen, kiest hij er één en vertaalt of vervormt hij de rest. Als één taal domineert, geef je die expliciet op. Bij echt gemengde opnames kun je beter per segment draaien.
Zeer lange opnames met sprekerherkenning. Boven het half uur wordt de sprekerherkenning traag. Draai die dan op de achtergrond en plan er iets anders omheen.
Wanneer je dit wél doet
De afweging is per soort opname, niet principieel.
Doen bij klantgesprekken, sollicitatiegesprekken, functioneringsgesprekken, en alles met medische, financiële of juridische inhoud. Daar is de vraag "waar staat die opname nu" er een die je moet kunnen beantwoorden.
Niet nodig bij je eigen spraakmemo's, publieke webinars, podcasts en presentaties die toch al openbaar zijn.
Twijfelgeval: interne vergaderingen. Mijn eigen regel is dat overleggen waarin personen worden besproken lokaal gaan en de rest niet.
Het kortste pad om te beginnen
Werk je op een Mac met Apple Silicon: installeer mlx-whisper, haal het large-v3-turbo model op, en draai het op een oude opname die je al hebt uitgewerkt. Dan kun je vergelijken en weet je binnen een half uur of de kwaliteit voldoet voor jouw soort gesprekken.
Werk je op Windows: begin met whisper.cpp en reken op meer uitzoekwerk. Het werkt, het is alleen minder kant-en-klaar dan op macOS.
Doe die eerste test bewust op materiaal waarvan je het juiste antwoord kent. Anders beoordeel je een transcript dat vloeiend leest en niet klopt, en dat is de meest kostbare vorm van vertrouwen.
Veelgestelde vragen
Waar dit heen gaat
Lokale transcriptie is het eenvoudigste stuk van lokale AI, en daarom een goed startpunt als je wilt uitzoeken wat er zonder cloud kan. De modellen zijn volwassen, de hardware is er, en de afweging is inzichtelijk.
Ik heb hetzelfde principe toegepast op iets moeilijkers: een sales copilot die tijdens een gesprek meeluistert en volledig lokaal transcribeert. Dat is OnCue, en de code is open: github.com/Vinix24/OnCue. Draait op macOS met Apple Silicon; de Windows-kant is nog niet af.
Wil je meedenken of meekijken, dan staat de wachtlijst op /oncue.