Hoe nauwkeurig is Whisper? Echte cijfers, van audioboeken tot vergaderruimtes (2026)
LoroNote-team9 min

Inhoud
- Wat het woordfoutpercentage werkelijk meet
- De nauwkeurigheidsladder: één model, vier sporten
- Welke Whisper? De variant verandert het antwoord
- Taal verschuift het cijfer meer dan welke softwarekeuze ook
- Hallucinaties: de fout die WER onderschat
- Wat de nauwkeurigheid op jouw opnames werkelijk bepaalt
- Zo meet je Whispers nauwkeurigheid zelf in tien minuten
- Veelgestelde vragen
- Conclusie
- Officiële bronnen
Kort antwoord: er bestaat geen los nauwkeurigheidscijfer voor Whisper — er bestaat een ladder. Bij schone, voorgelezen spraak met één spreker halen de large-modellen ruwweg 2–3% woordfoutpercentage (WER), oftewel meer dan 97 van de 100 woorden goed. Over een mix van echte Engelse benchmarks komt Whisper Large V3 gemiddeld uit rond 7,4% WER. Op vergaderruimte-audio met verre microfoons en door elkaar pratende sprekers draait hetzelfde model rond de 16%. En bij talen met weinig trainingsdata kan het foutpercentage nog eens verdrievoudigen. Of Whisper “nauwkeurig” is, hangt af van de sport waarop jouw opname staat — en minstens zozeer van welke Whisper-variant de app die je gebruikt werkelijk draait.
Elk cijfer in dit artikel komt uit OpenAI’s gepubliceerde paper en modelkaarten of van het publieke Open ASR Leaderboard, gelinkt in de bronnen onderaan. Het is geschreven door het LoroNote-team op 19 augustus 2026. LoroNote draait Whisper Large V3 Turbo op het apparaat, dus we hebben hier een belang — en precies daarom is niets hieronder een eigen marketingcijfer.
Wat het woordfoutpercentage werkelijk meet
WER telt de woorden die een transcriptie fout heeft — vervangen, weggevallen of verzonnen — als aandeel van de gesproken woorden. Een WER van 5% betekent één fout per 20 woorden; 16% betekent één op de zes. Uit die definitie volgen twee dingen:
- Een WER betekent alleen iets naast de audio waarop hij is gemeten. “98% nauwkeurig” zonder benoemde testset is een slogan, geen meting. Hetzelfde model haalt 97%+ op een audioboek en 84% in een vergaderzaal zonder dat er iets misgaat.
- Niet elke fout kost evenveel. Een weggevallen “eh” en een verkeerde medicijnnaam tellen allebei één keer. WER is de standaardmaatstaf omdat hij objectief is, niet omdat hij vangt hoe bruikbaar een transcript aanvoelt — en daarom verslaat testen op je eigen audio, verderop beschreven, elke tabel.
De volledige definitie — de formule, waarom WER boven de 100% kan uitkomen en de normalisatiestap die gepubliceerde cijfers stilletjes verschuift — nemen we door in Wat is word error rate?
De nauwkeurigheidsladder: één model, vier sporten
Dit zijn gepubliceerde cijfers voor Whispers large-modellen op standaardbenchmarks:
| Audio-omstandigheden | Benchmark | WER bij benadering | Bron |
|---|---|---|---|
| Schone voorgelezen spraak, één spreker | LibriSpeech test-clean | ~2–3% | OpenAI’s Whisper-paper (2,7%, large) |
| Gemengde echte Engelse audio, acht testsets | Gemiddelde Open ASR Leaderboard | ~7,4% (Large V3) | Open ASR Leaderboard |
| Vergaderruimtes, verre microfoons, doorpraten | AMI-vergadercorpus | ~16% (Large V3) | Open ASR Leaderboard |
| Voorbeeld van taal met weinig data | Hindi (Common Voice) | ~27% (Large V3) | Modelkaart openai/whisper-large-v3 |
Lees de ladder van boven naar beneden en het patroon is duidelijk: het model wordt niet slechter — de audio wordt het. Dicteren in een telefoon vlak bij je mond zit bij de bovenste sport. Een interview aan een cafétafeltje zit in het midden. Een vergadering opgenomen vanaf het verre uiteinde van de tafel zit op de derde sport, nog voordat er ook maar één softwarekeuze is gemaakt.
Welke Whisper? De variant verandert het antwoord
“Aangedreven door Whisper” beslaat een familie, niet één model. Whisper bestaat in maten van tiny tot large, en de spreiding daartussen is groter dan de spreiding tussen leveranciers:
- Large V3 is het vlaggenschip qua nauwkeurigheid. OpenAI trainde het op 1 miljoen uur zwak gelabelde audio plus 4 miljoen uur pseudo-gelabelde audio, en rapporteert 10–20% minder fouten dan Large V2 over een breed scala aan talen.
- Large V3 Turbo is de op snelheid geoptimaliseerde afgeleide: 809 miljoen parameters, met de decoder teruggebracht van 32 naar 4 lagen. OpenAI omschrijft de prijs als “geringe kwaliteitsafname” — op het Open ASR Leaderboard liggen de gemiddelden dicht bij elkaar (ongeveer 7,8% tegenover 7,4% gemiddelde WER; ongeveer 16,1% tegenover 16,0% op AMI). Gecombineerd over talen presteert hij vergelijkbaar met Large V2, en hij verliest het meest in enkele talen zoals Thai en Kantonees. We hebben die afweging uitgeplozen in onze gids over Whisper Large V3 Turbo.
- Small en medium draaien meerdere WER-punten hoger — een echt gat, zichtbaar in een test van één alinea. Op iPhones telt dit extra, omdat verschillende bekende “Whisper-apps” small of medium op de telefoon draaien, ook als hun Mac-versies large draaien. Onze vergelijking van Whisper-apps somt op welke variant elke iOS-app werkelijk laadt.
De praktische regel: vergelijk apps pas op nauwkeurigheid nadat je hebt gecontroleerd welke Whisper elk draait. Een app die Large V3 Turbo draait en een app die small draait, bieden niet dezelfde nauwkeurigheid — wat beide pagina’s ook zeggen over “Whisper AI”.
Taal verschuift het cijfer meer dan welke softwarekeuze ook
Whispers trainingsdata helt sterk over naar talen met veel materiaal, en de nauwkeurigheid volgt. Engels, Spaans, Duits, Japans, Koreaans en andere goed vertegenwoordigde talen clusteren rond de gemiddelden hierboven. Talen met weinig data zitten veel hoger — het Hindi-cijfer in de tabel is één gepubliceerd voorbeeld, en OpenAI’s modelkaart signaleert ook ongelijke prestaties tussen accenten en dialecten binnen talen.
Whisper Large V3 dekt ongeveer 100 talen (Kantonees kwam erbij met V3), dus “ondersteund” en “even nauwkeurig” zijn verschillende claims. Valt jouw taal buiten de groep met veel trainingsdata, dan is het eerlijke advies hetzelfde als overal in dit artikel: transcribeer een korte eigen opname en bekijk het resultaat — de volledige talenlijst vertelt je wat LoroNote gaat proberen, en twee minuten eigen audio vertelt je hoe goed.
Hallucinaties: de fout die WER onderschat
OpenAI’s modelkaart zegt het onomwonden: omdat de modellen zijn getraind op grootschalige ruizige data, “kunnen de voorspellingen tekst bevatten die niet daadwerkelijk in de audio-invoer is uitgesproken (oftewel hallucinatie)”. In de praktijk duikt dit op bij stilte, achtergrondgeluid en muziek — Whisper is een generatief model, en als er geen spraak is om het te verankeren, kan het vloeiende zinnen produceren die niemand heeft gezegd.
Twee dingen houden dit beheersbaar:
- Apps kunnen het beperken. Spraakactiviteitsdetectie die stille stukken overslaat, ontneemt het model zijn belangrijkste kans om tekst te verzinnen. Dit is gedrag op app-niveau, geen modelinstelling, en het is een van de echte verschillen tussen apps die dezelfde Whisper draaien.
- Je kunt het herkennen. Gehallucineerde tekst verschijnt meestal op stukken waarvan je weet dat ze stil waren — het einde van een opname, een lange pauze. Is het midden van een transcript solide maar zijn er in de stiltes zinnen gegroeid, dan kijk je naar hallucinatie, niet naar verkeerd verstaan.
We hebben dit gedrag vergeleken met een model met transducer-architectuur in Parakeet V3 vs Whisper Large V3 — transducers hallucineren minder bij stilte, terwijl Whisper veel meer talen dekt; gratis lunches bestaan niet.
Wat de nauwkeurigheid op jouw opnames werkelijk bepaalt
Benchmarks variëren de audio; jouw opnames variëren dezelfde dingen. In grofweg aflopende volgorde van impact:
- Microfoonafstand. Veruit de grootste hefboom. Een telefoon op armlengte op tafel verslaat een telefoon aan de andere kant van de kamer met meer dan welke modelupgrade ook.
- Lawaai en muziek. Constant achtergrondgeluid richt beperkte schade aan; muziek en gekletter des te meer.
- Door elkaar pratende sprekers. Doorpraten is waarom vergadercorpora op ~16% zitten terwijl audio met één spreker op ~3% zit.
- Vakjargon. Namen, medicijnen, tickers en jargon falen onevenredig vaak. LoroNotes aangepaste woordenboek bestaat precies hiervoor: terugkerende termen die het niet meer fout mag doen.
- De modelvariant — de enige factor hierboven die puur een softwarekeuze is, en de reden dat LoroNote de grootste Whisper-variant draait die praktisch haalbaar is op de telefoon.
Sprekerlabels verdienen een kanttekening: diarisatie verandert de WER niet, maar wél of een transcript met meerdere sprekers überhaupt bruikbaar is. Een nauwkeurig transcript zonder sprekers blijft handwerk; hoe sprekeridentificatie werkt behandelt die helft van het probleem.
Zo meet je Whispers nauwkeurigheid zelf in tien minuten
Een test op je eigen audio gaat boven elke tabel in dit artikel:
- Neem ongeveer twee minuten op die op je echte gebruik lijken — dezelfde ruimte, dezelfde afstand, dezelfde taal, echte namen en jargon. Twee minuten spraak is ruim 250 woorden: genoeg voor de telling in stap 3.
- Transcribeer de opname en lees het resultaat naast de audio.
- Tel de fouten in een stuk van 200 woorden: elk vervangen, ontbrekend of verzonnen woord. Fouten ÷ 200 = jouw WER.
- Beoordeel de fouten, niet alleen het aantal: vijf verhaspelde stopwoordjes en vijf verhaspelde klantnamen zijn dezelfde WER, maar een heel andere dag.
De precieze versie van deze methode — inclusief hoe je vooraf bepaalt wat als fout telt — staat in onze WER-gids.
Omdat LoroNote op het apparaat transcribeert en de gratis versie de eerste twee minuten van elke opname transcribeert — precies genoeg voor deze test — kost de proef niets, en de opname verlaat nooit je iPhone: er is geen uploadstap, geen account, en de vliegtuigmodus verandert niets.
Veelgestelde vragen
Is Whisper nauwkeurig genoeg voor professionele transcripten?
Voor schone opnames met een dichtbijgeplaatste microfoon in talen met veel trainingsdata leveren Whispers large-modellen concepten die de meeste mensen maar licht redigeren — de 2–3% WER bij schone spraak zit dicht bij het praktische plafond voor automatische systemen. Voor vergaderingen met verre microfoons, veel doorpraten of kritieke exacte formuleringen: reken op nakijktijd. Bij 16% WER vraagt één op de zes woorden je aandacht.
Verliest Whisper Large V3 Turbo nauwkeurigheid ten opzichte van Large V3?
Een beetje. OpenAI noemt de afname gering, en de publieke leaderboard-gemiddelden liggen in het Engels ruim minder dan een punt uit elkaar. Gecombineerd over talen presteert Turbo vergelijkbaar met Large V2, met de grootste verliezen in enkele talen zoals Thai en Kantonees. In ruil daarvoor is hij drastisch sneller — de ruil die een model uit de Large-serie praktisch maakt op een telefoon.
Waarom bevat mijn transcript zinnen die niemand heeft gezegd?
Dat is hallucinatie, gedocumenteerd gedrag van Whisper bij stilte, lawaai en muziek: een generatief model zonder spraak om het te verankeren kan alsnog vloeiende tekst produceren. Controleer de stille stukken van je opname. Apps die vóór Whisper spraakactiviteitsdetectie draaien, vermijden het grotendeels — het is app-gedrag, geen gebruikersinstelling.
Vermindert Whisper op het apparaat draaien de nauwkeurigheid?
Nee. Dezelfde modelgewichten leveren dezelfde transcriptiekwaliteit, waar ze ook draaien; on-device-inferentie is geen uitgeklede modus. Wat tussen apps verschilt, is welke variant ze draaien — clouddiensten hosten de grootste modellen moeiteloos, terwijl on-device-apps in de telefoon moeten passen, en daarom draaien sommige small of medium. LoroNote draait Large V3 Turbo lokaal, en houdt zo een model uit de Large-serie en on-device-privacy in één app.
Conclusie
“Hoe nauwkeurig is Whisper” heeft een vorm, geen getal: ruwweg 2–3% WER bij schone voorgelezen spraak, zo’n 7% over gemengde Engelse benchmarks, rond 16% bij vergaderaudio, en slechter bij talen met weinig trainingsdata — met hallucinatie als de kanttekening die WER onderschat. De twee keuzes die je eigen resultaten het meest beïnvloeden zijn fysiek (zet de microfoon dichterbij) en structureel (weet welke Whisper-variant je app draait). De rest meet je in tien minuten met een eigen opname — de enige benchmark die ooit over jou ging.
Officiële bronnen
Je stem wordt tekst — offline
LoroNote transcribeert vergaderingen, colleges en interviews direct op je iPhone — privé, nauwkeurig en onbeperkt.
Download in de App Store