Gids

Transcriptie nauwkeuriger maken: vijf knoppen op volgorde van effect (2026)

LoroNote Team11 min

Het meeste advies over transcriptienauwkeurigheid blijft algemeen. Deze gids zet de vijf knoppen waar je aan kunt draaien op volgorde van gemeten effect: microfoonafstand, door elkaar pratende sprekers, ruis en stilte, taal en woordenschat, en de modelvariant — met de gepubliceerde cijfers die laten zien hoeveel verschil elke knop echt maakt.

Kort antwoord: hoe nauwkeurig een transcriptie wordt, staat grotendeels al vast voordat er ook maar één regel software draait. Op volgorde van gemeten effect: microfoonafstand en ruimteakoestiek (hetzelfde topmodel dat 2–3% word error rate haalt op dichtbij opgenomen spraak, komt uit rond 16% op vergaderingen met verre microfoons — vijf keer zoveel fouten), door elkaar pratende sprekers (de hoofdreden dat vergaderaudio onderaan elke benchmark bungelt), ruis en lange stiltes (juist in stilte hallucineren spraakmodellen tekst die niemand heeft gezegd), taal en woordenschat (gepubliceerde foutpercentages per taal lopen meer dan een factor tien uiteen), en ten slotte de modelvariant — de enige knop die puur een softwarekeuze is. Hieronder staat bij elke bewering het gemeten cijfer.

Deze gids is geschreven door het LoroNote-team op 27 augustus 2026. Elk benchmarkcijfer erin komt uit de primaire bronnen die we verzamelden op onze geverifieerde statistiekenpagina; de meetmethode aan het einde komt uit onze word error rate-gids. LoroNote draait Whisper Large V3 Turbo op het apparaat, dus betere opnameomstandigheden verbeteren de uitvoer van ons eigen product — we hebben er geen belang bij je te vertellen dat je nauwkeurigheid wel prima is zoals ze is.

De vijf knoppen, gerangschikt op gemeten effect

KnopHet gemeten bewijsWat jij bepaalt
1. Microfoonafstand~2–3% WER dichtbij opgenomen vs ~16% op vergaderingen met verre microfoons (zelfde model)Waar de telefoon ligt
2. Door elkaar pratende sprekersVergaderaudio met door elkaar praten bungelt onderaan elke benchmarkOm de beurt spreken, zitplaatsen
3. Ruis en stilteModellen zakken scherp weg onder ~10 dB SNR; hallucinaties concentreren zich op stilteOmgeving, wegknippen
4. Taal en woordenschatGepubliceerde WER’s per taal lopen van 4,3% tot 55,7%; namen en vaktermen falen eerstAangepast woordenboek, duidelijke namen
5. ModelvariantWhisper Small scoorde in één run ruwweg dubbel zoveel fouten als Large-klasse enginesWelke app — de enige pure softwareknop

De volgorde doet ertoe. Wie op zoek gaat naar een betere app, grijpt meestal naar knop 5, terwijl knoppen 1–3 de schade aanrichten.

Dynamische Shure SM57-microfoon op een witte ondergrond

Een dynamische podiummicrofoon — maar de knop waar je aan draait is niet de hardware, wel hoe dicht een microfoon (ook die van je telefoon) bij de stem staat. Bron:

Wikimedia Commons (E bailey)

, CC BY-SA 4.0.

Knop 1: microfoonafstand — goed voor een factor vijf

De grootste nauwkeurigheidsfactor is hoe ver de microfoon van de mond ligt. De zuiverste gepubliceerde demonstratie is één model, gemeten onder verschillende omstandigheden: Whisper Large V3 haalt gemiddeld ongeveer 7,4% WER over acht uiteenlopende Engelse testsets, ruwweg 2–3% op schone, dichtbij opgenomen voorgelezen spraak — en rond 16% op het AMI-corpus, dat is opgenomen in vergaderzalen met verre microfoons. Aan de software veranderde tussen die rijen niets.

Wat je concreet doet:

  • Schuif met je telefoon, niet met je budget. Een telefoon vlak bij de spreker verslaat een dure opstelling aan de andere kant van de kamer. Bij een interview met z’n tweeën hoort de telefoon tussen jullie in, iets dichter bij de zachtste stem.
  • Leg het apparaat in vergaderingen midden op tafel, niet bij je eigen stoel. Elke extra meter naar de verste spreker kost meer dan overstappen op een andere app ooit terugwint.
  • Dicteer je in je eentje, dan zit je al goed. Op armlengte in een telefoon spreken ís dichtbij opgenomen spraak — de bovenste sport van de ladder. Zijn je solo-opnames toch onnauwkeurig, dan ligt het probleem bij een van de knoppen hieronder, niet bij de afstand.

Knop 2: door elkaar pratende sprekers

Door elkaar praten is de tweede reden dat vergaderaudio onderaan de benchmarks hangt. Wanneer twee mensen tegelijk spreken, is er simpelweg geen schoon signaal om te transcriberen — het model moet één stem kiezen, en elk woord van de ander wordt een fout. Dit is eerst en vooral een natuurkundig probleem, geen softwareprobleem, en daarom overleeft het elke modelupgrade.

Wat je concreet doet:

  • Elkaar laten uitpraten levert meer op dan welke instelling ook. In vergaderingen waar jij over gaat, is die discipline pure winst voor de nauwkeurigheid.
  • Zet de belangrijke stemmen dicht bij de microfoon. Als een beslisser mompelt vanuit de verste hoek, is dat precies de plek waar je transcript de mist ingaat.
  • Reken erop dat ook sprekerlabels lijden onder overlap. Vaststellen wie wat zei is een aparte stap, die op zijn eigen manieren misgaat — hoe sprekerherkenning werkt laat zien waar. Een transcript kan alle woorden goed hebben en ze bij door elkaar praten toch aan de verkeerde spreker toeschrijven.

Knop 3: ruis, muziek en stilte

Gestage achtergrondruis tast transcriptie geleidelijk aan; de robuustheidstests in het Whisper-paper zelf laten herkenning instorten zodra toegevoegde ruis ruwweg de grens van 10 dB signaal-ruisverhouding passeert — het niveau van een luid café of een kroeg, waar concurrerende modellen zelfs sneller wegzakten dan Whisper. Muziek is erger dan ruis, om een subtielere reden: spraakmodellen die op enorme webcorpora zijn getraind hebben veel muziek met songteksten gezien, en ze zullen proberen die te transcriberen.

Ook stilte kent een eigen valkuil. Een studie uit 2024 naar de Whisper-API vond gehallucineerde zinsdelen in ruwweg 1% van de transcripties — verzonnen zinnen, geconcentreerd waar de audio stilvalt, en onevenredig vaak in de spraak van mensen die langere pauzes laten vallen. (Inserties die uit stilte ontstaan zijn ook hoe een word error rate boven de 100% kan uitkomen.)

Wat je concreet doet:

  • Kies de stillere kamer boven de betere microfoon. Een telefoon in een stille ruimte verslaat een goede microfoon in een lawaaiige.
  • Zet achtergrondmuziek uit wanneer een opname ertoe doet. Muziek maskeert de stem én dingt als tekst mee naar een plek in je transcript.
  • Knip lange stille stukken weg vóór het transcriberen, of neem in segmenten op — stilte is geen neutrale opvulling; het is waar verzonnen tekst verschijnt. En lees de stille momenten van het transcript daarna met argwaan.

Knop 4: taal, accent en woordenschat

Gepubliceerde cijfers per taal voor hetzelfde Whisper-model lopen meer dan een factor tien uiteen — van 4,3% (Nederlands) tot 55,7% (Albanees) op Common Voice 15. Ook accentverschillen zijn echt en gedocumenteerd: peer-reviewed onderzoek mat een gemiddeld foutpercentage van 35% voor zwarte Amerikaanse sprekers tegenover 19% voor witte sprekers, over vijf commerciële systemen zoals die er in 2019 bij stonden. De trainingsdata van een model verander je niet met een instelling — maar twee dingen heb je werkelijk zelf in de hand:

  • Namen, vaktermen en productnamen falen als eerste en blijven falen. Een model heeft de naam van jouw klant nooit gezien; het gokt elke keer hetzelfde verkeerde woord. Dit is het ene nauwkeurigheidsprobleem met een directe oplossing: het aangepaste woordenboek van LoroNote bestaat om terugkerende termen één keer aan te leren, waarna het model stopt met gokken.
  • Spreek getallen, namen en codes bewust uit. Die gewoonte kost niets en richt zich precies op de woorden waarvan fouten het duurst zijn — een verhaspelde datum en een verhaspeld stopwoordje tellen in een benchmark even zwaar, maar niet in jouw dag.
  • Staat jouw taal laag op de gepubliceerde grafieken, dan zegt een test van twee minuten op je eigen audio meer dan welke tabel ook — de grafiek per taal, en waarom sommige talen met CER in plaats van WER worden gescoord, staan in de WER-gids.

Knop 5: de modelvariant — de enige pure softwareknop

Is de audio zo goed als de omstandigheden toelaten, dan blijft er één knop over: welk model je app draait. En de spreiding is niet subtiel. In de enige benchmark die beide klassen naast elkaar draaide, scoorde Whisper Small 3,74% op LibriSpeech test-clean en 7,95% op test-other, terwijl engines van Large-klasse rond 2% en 4,5% zaten — ruwweg de helft van de fouten, door een modelkeuze die de app voor jou maakte. “Powered by Whisper” op een app-pagina dekt varianten waarvan de nauwkeurigheid een factor twee uiteenloopt, en meerdere iOS-apps laden stilletjes de kleine varianten.

Wat je concreet doet: controleer, voordat je om nauwkeurigheid van app wisselt, welke variant elke app werkelijk laadt. LoroNote draait Whisper Large V3 Turbo — een model uit de Large-familie — op het apparaat; op een iPhone 15 Pro transcribeert dat op ruwweg 19× realtime (onze eigen meting), dus voor de nauwkeurigheid van een groot model hoef je geen koffiepauze in te lassen.

Wat weinig helpt

Drie fixes waar mensen naar grijpen en die het bewijs niet steunt:

  • Opnemen op een hogere samplefrequentie. Whisper hersamplet alle audio naar 16.000 Hz voordat het luistert — het paper zegt het letterlijk. Een studiobestand van 96 kHz en een gewoon spraakmemo komen bij het model identiek aan; steek de moeite liever in afstand en stilte.
  • Een nieuwere telefoon. De microfoon in elke recente iPhone is niet de bottleneck; zijn positie is dat. (Een nieuwere telefoon kan wel sneller transcriberen, maar dat is een andere eigenschap.)
  • “Verbeterings”-filters vóór het transcriberen. Agressieve ruisonderdrukking kan de harmonische structuur uitsmeren die het model juist nodig heeft. Gebruik je er een, doe dan een vóór-en-na-meting op dezelfde clip in plaats van te vertrouwen op wat schoner klinkt — wat schoner klinkt voor jouw oor, is niet per se schoner voor het model.

Meet het effect, vaar niet op gevoel

Elke knop hierboven is in tien minuten te testen: neem twee minuten op in je huidige opstelling, transcribeer, tel de fouten in een stuk van 200 woorden met vaste regels; verander één ding — verplaats de telefoon, zet de muziek uit — en draai dezelfde passage opnieuw. De volledige telmethode, inclusief vooraf vastleggen wat als fout telt, staat in onze WER-gids. Omdat LoroNote op het apparaat transcribeert en de eerste twee minuten van elke opname gratis zijn, kost het vóór-en-na-experiment niets en werkt het ook met de vliegtuigmodus aan.

Veelgestelde vragen

Waarom is mijn transcriptie zo onnauwkeurig?

Loop de knoppen op volgorde af: hoe ver de microfoon van de sprekers lag, of mensen door elkaar praatten, hoe luid de ruimte was en hoeveel stilte de opname bevat, of het vooral namen en vaktermen zijn die misgaan, en ten slotte welk model je app draait. In gepubliceerde benchmarks verschuift alleen al de stap van dichtbij opgenomen naar verre-microfoonaudio hetzelfde model van ruwweg 2–3% naar rond 16% word error rate — meer dan welke app-wissel dan ook terugwint.

Verbetert een externe microfoon de transcriptienauwkeurigheid?

Wat de nauwkeurigheid verbetert is de afstand; een externe microfoon is één manier om die te overbruggen. Een dasspeldmicrofoon op de spreker levert feitelijk dichtbij opgenomen spraak op, zelfs in een grote zaal. Maar een telefoon die je dichtbij neerlegt, bereikt het grootste deel van hetzelfde effect gratis — eerst de positie, dan pas de hardware.

Heeft achtergrondmuziek invloed op de transcriptie?

Ja, dubbel: ze maskeert de stem zoals elke ruis, en omdat spraakmodellen enorme hoeveelheden audio met songteksten hebben gezien, transcriberen ze soms het liedje in plaats van de spreker. Herkenning zakt bovendien scherp weg zodra ruis ruwweg het 10 dB signaal-ruisniveau van een luid café passeert. Zet muziek uit voor opnames die ertoe doen.

Kan ik accentfouten oplossen met een instelling?

Niet met een instelling — accentprestaties zitten in de trainingsdata van het model, en onderzoek heeft echte demografische verschillen gedocumenteerd. Wat wél in jouw hand ligt: kies een app die een model van Large-klasse draait (grotere modellen vangen meer variatie op), leer terugkerende namen en termen aan een aangepast woordenboek, en meet op je eigen twee minuten in plaats van te vertrouwen op gemiddelden die op andermans stemmen zijn gemeten.

Worden langere opnames minder nauwkeurig getranscribeerd?

Er is geen bewijs dat lengte op zichzelf de nauwkeurigheid drukt — het zijn de omstandigheden die tellen. Een college van drie uur, dichtbij en in stilte opgenomen, wordt tot het einde net zo goed getranscribeerd als de eerste tien minuten. Wat wél met de lengte meegroeit, is de tijd die het kost om fouten na te lopen — en daarom wegen de tips hierboven zwaarder naarmate je opnames langer duren.

Tot slot over transcriptie nauwkeuriger maken

Nauwkeurigheidsadvies wijst meestal naar software, omdat software nu eenmaal makkelijk te wisselen is. De metingen wijzen de andere kant op: de factor vijf zit in microfoonafstand en ruimteakoestiek, de hardnekkige fouten zitten in door elkaar praten en stilte, en de enige knop die echt bij de software hoort, is de modelvariant die je app laadt. Verplaats de telefoon, maak de kamer stil, spreek om de beurt, leer het systeem je namen en controleer het model — in die volgorde. En check elke verandering met een vóór-en-na-meting op je eigen opname, want het enige nauwkeurigheidscijfer dat ertoe doet, is het jouwe.

Bronnen

Cijfers opnieuw gecontroleerd tegen de gelinkte bronnen op 26–27 augustus 2026.

Je stem wordt tekst — offline

LoroNote transcribeert vergaderingen, colleges en interviews direct op je iPhone — privé, nauwkeurig en onbeperkt.

Download in de App Store