AI

Apple SpeechAnalyzer vs Whisper (2026): wat de benchmark niet mat

LoroNote Team10 min

Apples SpeechAnalyzer op het apparaat versloeg Whisper in een veelgedeelde benchmark, maar die test draaide Whisper Small op Engelse luisterboeken. Wat er wel is gemeten, wat niet, en welke engine bij welke opname past.

Kort antwoord: in de benchmark die iedereen deelde, versloeg Apples nieuwe SpeechAnalyzer op het apparaat Whisper inderdaad — 2,12% woordfoutpercentage tegen 3,74% op LibriSpeech test-clean. Alleen draaide die test Whisper Small, op Engelse luisterboeken, op een Mac. Whisper Large V3 en Large V3 Turbo, de modellen die een app op het apparaat werkelijk laadt, kwamen er niet in voor, en er zat geen vergadering, geen accent en geen van de ongeveer 99 andere talen van Whisper bij. Apples engine is snel, nauwkeurig en gratis, binnen de 22 talen die hij ondersteunt. Whisper dekt er ongeveer vijf keer zoveel.

Alle cijfers hieronder komen uit het stuk van de benchmarkauteur zelf, uit de gepubliceerde papers en modelkaarten van OpenAI, uit het Open ASR Leaderboard of uit Apples ontwikkelaarsdocumentatie — alles staat onderaan gelinkt. Dit stuk is geschreven door het LoroNote-team op 23 augustus 2026. LoroNote draait Whisper Large V3 Turbo op het apparaat, dus we hebben belang bij deze vergelijking. Juist daarom is elk cijfer hier de meting van iemand anders, niet die van ons.

Wat SpeechAnalyzer eigenlijk is

SpeechAnalyzer is het spraakframework dat Apple op WWDC 2025 presenteerde en met iOS 26 uitbracht. Het vervangt SFSpeechRecognizer, de verouderde API die tien jaar lang het grootste deel van de dictatie van externe apps op iOS droeg.

Twee publieke modules doen ertoe:

  • SpeechTranscriber zet spraak om in tekst.
  • SpeechDetector markeert waar er in een audiostroom gesproken wordt.

Alles draait op het apparaat. De taalbestanden worden via de systeemcatalogus gedownload in plaats van door elke app apart meegeleverd, en daarom groeit de downloadgrootte van een app die deze API gebruikt nauwelijks. Voor talen die SpeechTranscriber niet dekt, biedt Apple DictationTranscriber als terugvaloptie.

Er is één harde voorwaarde die de meeste vergelijkingen overslaan: SpeechAnalyzer vereist iOS 26 of nieuwer en is niet achterwaarts compatibel. Op een iPhone die nog op iOS 18 draait, bestaat de functie eenvoudigweg niet.

De benchmark die iedereen citeerde

De cijfers die in juli 2026 door de techmedia gingen, komen uit één evaluatie van een ontwikkelaar. Dit is wat er werkelijk gemeten is:

VoorwaardeWaarde
CorpusLibriSpeech — 5.559 uitingen (2.620 test-clean, 2.939 test-other)
AudioVoorgelezen luisterboekspraak, één spreker, schone opname
Taalalleen Engels
HardwareM2 Pro, 32 GB, macOS 26.5.1, volledig op het apparaat
Geteste Whisper-variantenTiny, Base, Small

En de resultaten:

EngineWER test-cleanWER test-other
Apple SpeechAnalyzer2,12%4,56%
Whisper Small (~460 MB)3,74%7,95%
Whisper Base (~140 MB)5,42%12,51%
Whisper Tiny (~40 MB)7,88%17,04%
SFSpeechRecognizer (oud)9,02%16,25%

Twee dingen mogen over deze tabel gewoon gezegd worden. Apples voorsprong op de eigen oude API is enorm — ongeveer 75% minder fouten, en dat is het echte nieuws voor iedereen die op SFSpeechRecognizer had gebouwd. En Apple heeft elk getest Whisper-model daadwerkelijk verslagen.

Het probleem is welke modellen getest zijn.

Drie dingen die de benchmark niet mat

1. De Whisper-modellen die apps op het apparaat echt draaien

Whisper Small is een model van 460 MB. Het is niet wat een serieuze transcriptie-app op een moderne iPhone laadt. LoroNote draait Large V3 Turbo: 809 miljoen parameters, met de decoder teruggebracht van 32 lagen naar 4 voor snelheid.

De benchmark stopte vóór Medium, Large en Turbo. Ter vergelijking: gepubliceerde evaluaties zetten Whisper Large V3 op LibriSpeech rond 2,0–2,5% WER op test-clean en ongeveer 3,9–4,3% op test-other — dezelfde buurt als Apples 2,12% en 4,56%, of iets beter.

Behandel die vergelijking voorzichtig. Die Whisper-cijfers komen uit losse evaluaties met hun eigen tekstnormalisatie, niet uit een rechtstreeks duel op dezelfde machine tegen Apples engine. Alleen de keuze van normalisatie kan de LibriSpeech-WER al meer dan een punt verschuiven — hoe dat gebeurt, leggen we uit in onze WER-gids. De eerlijke conclusie is niet “Whisper Large wint”. Ze is dat geen enkele gepubliceerde test Apples engine heeft vergeleken met de Whisper-modellen waar het eigenlijk om gaat — en dat het gat dat de koppen suggereerden een gevolg is van de gekozen modelgrootte.

2. Alles wat lastiger is dan een studioluisterboek

LibriSpeech is voorgelezen spraak: één persoon, een boek, een goede microfoon, niemand die door elkaar praat. Het is de onderste sport van de ladder, en juist daar zet elke engine zijn beste cijfer neer.

Echte opnames zitten hoger. Op de nauwkeurigheidsladder die we voor Whisper hebben vastgelegd haalt datzelfde Large V3 dat 2–3% scoort op schone voorgelezen spraak gemiddeld rond 7,4% over een mix van echte Engelse benchmarks en zo’n 16% op AMI-vergaderaudio met verre microfoons en door elkaar pratende stemmen.

Voor SpeechAnalyzer heeft niemand die sporten gepubliceerd. Zolang dat zo blijft, zegt 2,12% op een luisterboek erg weinig over een vergadering met vier mensen, opgenomen vanaf het midden van de tafel. De auteur van de benchmark was daar open over: het stuk beschrijft het corpus als “voorgelezen luisterboekspraak, geen vergaderingen”.

3. Negenennegentig andere talen

Dit is het grootste gat, en de auteur benoemde het rechtstreeks: de cijfers zeggen “niets over de meer dan 100 talen die Whisper ondersteunt”.

In augustus 2026 geeft SpeechTranscriber.supportedLocales 42 regionale varianten in 22 talen:

Arabisch, Chinees (vereenvoudigd, traditioneel, Hongkong), Deens, Duits, Engels (negen regionale varianten), Fins, Frans, Hebreeuws, Italiaans, Japans, Kantonees, Koreaans, Maleis, Nederlands, Noors (bokmål), Portugees, Russisch, Spaans, Thai, Turks, Vietnamees en Zweeds.

Whisper Large V3 dekt er ongeveer 100. De ontbrekende talen bij Apple zijn geen randgevallen: geen Hindi, geen Pools, geen Tsjechisch, geen Grieks, geen Oekraïens, geen Indonesisch. Portugees bestaat alleen als pt_BR; een Europees-Portugese variant ontbreekt.

Voor Nederlandstalige lezers ligt het knelpunt ergens anders. nl_NL en nl_BE staan allebei op Apples lijst, dus aan de ondersteuning ligt het niet. Het punt is dat er voor het Nederlands bij geen van beide engines gepubliceerde nauwkeurigheidscijfers bestaan. De veelgeciteerde benchmark mat alleen Engels, en Apple publiceert geen WER per taal. Wie vandaag beweert dat Apple Nederlands beter transcribeert dan Whisper, of andersom, heeft daar geen grond voor. Twee minuten van je eigen opname zijn voorlopig de stevigste bron.

Apple heeft gezegd dat er meer talen bij komen, dus deze lijst veroudert ooit. Maar “ondersteund” en “even nauwkeurig” blijven bij beide engines twee verschillende beweringen. Daarom loont het om de volledige talenlijst tegen je eigen audio te houden in plaats van op een aantal te vertrouwen.

Over dat “drie keer sneller”

De snelheidsclaim reisde net zo ver als de nauwkeurigheid, met dezelfde voetnoot: gemeten tegen Whisper Small.

Wat de benchmark meldde, was een doorvoerbereik van ruwweg 12 tot 40 keer realtime op een M2 Pro — een uur audio in ongeveer 1,5 tot 5 minuten. De auteur hield de precieze tijden per model bewust achter tot er schonere metingen op een rustige machine zijn.

Dat bereik is echt en Apples engine is snel. Het komt alleen van een desktop-M-chip met 32 GB RAM, niet van een telefoon. Op de iPhone is de bindende beperking voor elk transcriptiemodel het geheugen, niet de rekenkracht. Dat is ook waarom verschillende bekende “Whisper-apps” op de telefoon stilletjes small of medium laden terwijl hun Mac-versies large draaien. We hebben op een rij gezet welke variant elke iOS-app werkelijk laadt.

Wanneer welke de betere keuze is

Geen van beide wint in het algemeen. Ze zijn voor verschillende taken gebouwd.

Kies Apple SpeechAnalyzer als:

  • je taal bij de 22 ondersteunde hoort, zeker bij Engels;
  • je apparaat op iOS 26 of nieuwer draait;
  • je live transcriptie wilt, met tussenresultaten die bijwerken terwijl iemand praat — daar is de API voor ontworpen;
  • je geen modeldownload en geen kosten wilt.

Kies de Whisper Large V3-familie als:

  • je taal buiten Apples lijst valt, of je opnames talen door elkaar mengen in één bestand;
  • je hetzelfde gedrag nodig hebt op oudere apparaten: Whisper-apps draaien ruim onder iOS 26;
  • je bestaande bestanden transcribeert in plaats van live spraak, waar nauwkeurigheid zwaarder weegt dan vertraging;
  • je wilt dat de transcriptie hetzelfde uitpakt, ongeacht de OS-versie.

Gratis is het in geen van beide richtingen. Apples engine integreert sneller, kost niets en is uitstekend binnen zijn bereik. Het bereik van Whisper is ongeveer vijf keer breder, en de Large-varianten betalen die breedte in modelgrootte en verwerkingstijd.

Wat dit betekent bij het kiezen van een iPhone-app

Twee praktische gevolgen.

Ten eerste betekent “AI-transcriptie” in de App Store inmiddels minstens drie verschillende dingen: een app die Apples SpeechAnalyzer op het apparaat aanroept, een app die een eigen Whisper-model lokaal draait, of een app die je audio naar een server stuurt. Privacy, offline werken en taaldekking verschillen volledig, en de omschrijvingen vermelden zelden welke het is. Onze vergelijking van iOS-spraak-naar-tekstapps sorteert ze op waar de audio wordt verwerkt.

Ten tweede zegt “op het apparaat” niets meer over nauwkeurigheid. Beide routes zijn lokaal. De vraag is verschoven van waar gaat mijn audio heen naar welk model, in welke grootte, in welke taal.

Test het zelf in vijf minuten

Benchmarks zijn gemiddelden over corpora die je nooit zult opnemen. Je eigen audio is de enige test die jouw vraag beantwoordt:

  1. Neem twee minuten op in de ruimte waar je normaal opneemt — jouw microfoon, jouw accent, een paar namen, cijfers en vaktermen.
  2. Transcribeer dat met de ingebouwde transcriptie van je iPhone (Dictafoon op een ondersteund apparaat, of een app die Apples engine gebruikt).
  3. Transcribeer hetzelfde bestand met een Whisper-app.
  4. Tel de fouten in een stuk van 200 woorden: elk vervangen, ontbrekend of verzonnen woord. Fouten ÷ 200 = jouw WER. (De volledige methode, inclusief hoe je bepaalt wat als fout telt, staat in onze WER-gids.)

Komen ze allebei schoon terug, neem dan de handigste. Het verschil laat zich meestal zien bij eigennamen, door elkaar heen praten en elke taal buiten de best bedeelde groep — precies waar de benchmark ophield te kijken.

Veelgestelde vragen

Is Apple SpeechAnalyzer nauwkeuriger dan Whisper?

Tegen Whisper Small op schone Engelse luisterboeken wel: 2,12% tegen 3,74% WER. Tegen Whisper Large V3 of Large V3 Turbo heeft niemand een rechtstreekse test gepubliceerd. Losse evaluaties zetten Large V3 op hetzelfde corpus gelijk of iets voor, maar door verschillende normalisatie is dat eerder een ruwe vergelijking dan een oordeel.

Welke is nauwkeuriger in het Nederlands?

Daar zijn geen cijfers over gepubliceerd. De veelgeciteerde benchmark mat alleen Engels en Apple geeft geen WER per taal vrij. nl_NL en nl_BE staan op Apples lijst, dus aan de ondersteuning ligt het niet. Voor nauwkeurigheid is een test met twee minuten eigen opname voorlopig de enige betrouwbare methode.

Werkt SpeechAnalyzer offline?

Ja. Het draait volledig op het apparaat en de taalbestanden worden eenmalig via de systeemcatalogus gedownload. Daarin komt het overeen met een lokale Whisper-app: geen van beide stuurt je audio naar een server.

Heb ik iOS 26 nodig?

Ja. SpeechAnalyzer vereist iOS 26 of nieuwer en is niet achterwaarts compatibel. Apps op Whisper-basis draaien op aanzienlijk oudere versies, en dat is een van de praktische redenen om beide engines in het oog te houden.

Herkent een van beide wie er spreekt?

Sprekerherkenning is een aparte stap naast transcriptie, en geen van beide engines doet dat als onderdeel van spraakherkenning. Apps bouwen dat er bovenop — hoe sprekerscheiding werkt legt uit wat daarbij komt kijken en waar het misgaat.

Waarom gebruikt LoroNote Whisper en niet Apples engine?

Vanwege taal- en apparaatbereik. LoroNote transcribeert ongeveer 100 talen, ook opnames met gemengde talen, op apparaten van ruim vóór iOS 26. Apples engine is uitstekend binnen zijn 22 talen, maar vervangt die breedte niet. De concrete modelkeuze leggen we uit in onze gids over Whisper Large V3 Turbo.

Bronnen

Benchmarkcijfers gecontroleerd op 23 augustus 2026. Apples lijst met ondersteunde talen verandert met OS-updates; controleer SpeechTranscriber.supportedLocales op een actuele build voordat je erop vertrouwt.

Je stem wordt tekst — offline

LoroNote transcribeert vergaderingen, colleges en interviews direct op je iPhone — privé, nauwkeurig en onbeperkt.

Download in de App Store