AI

On-device AI-transcriptie: hoe je iPhone Whisper draait (2026)

LoroNote Team9 min

On-device AI-transcriptie betekent dat het spraakmodel op de telefoon zelf draait — een uploadstap waarlangs je audio kan vertrekken, bestaat simpelweg niet. Wat er werkelijk gebeurt tussen microfoon en tekst, wat de Neural Engine doet, waarom het geheugen (niet de rekenkracht) bepaalt welk model je app laadt, en wat on-device echt niet kan.

Kort antwoord: on-device AI-transcriptie betekent dat het spraakherkenningsmodel op de processors van je eigen telefoon draait — de opname wordt tekst zonder ooit ergens naartoe te worden verstuurd. De privacybelofte zit in de architectuur, niet in een contract: een uploadstap waarlangs je audio kan vertrekken, bestaat simpelweg niet, en dat controleer je zelf door in vliegtuigmodus te transcriberen. On-device betekent ook niet minder nauwkeurig — dezelfde modelgewichten leveren dezelfde transcriptie op, waar ze ook draaien. Wat het wél betekent, is een hardwarebudget: het geheugen van een telefoon, niet zijn rekenkracht, bepaalt welke modelgrootte een app kan laden. Daarom draaien sommige apps stilletjes de kleine Whisper-varianten, terwijl andere een model uit de Large-familie aan boord hebben. Dit is wat er werkelijk gebeurt tussen de microfoon en de tekst.

Deze gids is geschreven door het LoroNote-team op 27 augustus 2026. LoroNote draait Whisper Large V3 Turbo volledig op het apparaat, dus dit artikel beschrijft het mechaniek waar ons eigen product op draait. Elk benchmarkcijfer linkt naar een primaire bron, de meeste verzameld op onze geverifieerde statistiekenpagina (Engels); de ene meting die van onszelf is, staat als zodanig gemarkeerd.

Wat ‘on-device’ werkelijk betekent

Elke transcriptiedienst doet hetzelfde werk; het verschil zit in waar het model draait.

StapCloudtranscriptieOn-device transcriptie
OpnemenOp je telefoonOp je telefoon
UploadenAudio gaat naar de servers van de aanbiederBestaat niet
SpraakmodelDraait op server-GPU’sDraait op de processors van de telefoon
ResultaatTekst komt terug over het netwerkTekst wordt lokaal weggeschreven
Werkt offlineNeeJa — niets heeft een verbinding nodig
Wie bij de audio kanJij en de infrastructuur van de aanbiederAlleen wie de telefoon in handen heeft

Het draait om de laatste twee rijen. Offline werken is geen functie die aan on-device transcriptie is toegevoegd; het is een bijproduct van de architectuur — nergens in de pijplijn is een netwerk nodig. En de privacy-eigenschap werkt precies zo: audio die nooit is geüpload kan niet worden bewaard, gelekt of door een aanbieder bekeken. Niet omdat een beleid belooft dat de aanbieder ervan afblijft, maar omdat er simpelweg geen kopie bestaat om vanaf te blijven. Dat is een uitspraak over architectuur, geen juridische garantie — wat het betekent voor jouw eigen verplichtingen, beoordeel je zelf. Het technische feit is controleerbaar in vliegtuigmodus.

De pijplijn: wat er gebeurt tussen microfoon en tekst

Moderne spraakmodellen zoals OpenAI’s Whisper verwerken audio in een paar concrete stappen, die in een on-device app allemaal lokaal draaien:

  1. Resamplen. De audio wordt omgezet naar 16.000 Hz — het paper stelt dat alle trainingsaudio naar die frequentie wordt geresampled, dus alles daarboven wordt weggegooid voordat het model ook maar luistert. (Ook daarom verbetert opnemen op studiofrequenties de nauwkeurigheid niet.)
  2. Het spectrogram. De golfvorm wordt een Mel-spectrogram — volgens het Whisper-paper een logaritmische weergave, berekend over vensters van 25 milliseconden met stappen van 10 milliseconden. Het model hoort geen ‘geluid’; het leest een soort afbeelding — een kaart die laat zien welke frequenties op welk moment energie dragen.
  3. Encoderen. Een Transformer-encoder verwerkt het spectrogram tot een interne representatie van wat er akoestisch is gezegd.
  4. Decoderen. Een Transformer-decoder schrijft het transcript token voor token, op basis van zowel de audiorepresentatie als de tekst die hij al heeft geproduceerd — daarom leest een Whisper-transcript zo vloeiend, en daarom kan het model ook vloeiende tekst verzinnen op stille stukken.

Voor geen van deze stappen maakt het uit waar hij draait. Een server-GPU en een telefoon voeren dezelfde wiskunde uit op dezelfde gewichten — precies daarom werd on-device transcriptie mogelijk zodra telefoonchips goed genoeg werden.

De hardware: wat de Neural Engine doet

Telefoonchips zijn al jaren niet meer alleen CPU’s. Apples A-serie chips bevatten naast de CPU en GPU een apart blok voor neurale-netwerkberekeningen — de Neural Engine — en Apple beschreef in zijn eigen aankondiging van de iPhone 15 Pro de Neural Engine van de A17 Pro als tot twee keer zo snel als zijn voorganger. Transcriptie-apps zetten hun modellen om naar Apples Core ML-formaat, zodat deze hardware de encoder en decoder efficiënt kan uitvoeren.

Illustratie van een Apple A16 Bionic system-on-a-chip

Een illustratie van een Apple A-serie chip. Naast de CPU en GPU bevatten chips als deze een aparte Neural Engine — het blok dat de wiskunde van het spraakmodel op het apparaat uitvoert. Bron:

Wikimedia Commons (Henriok)

, CC0.

De praktische beperking is echter niet hoe snel het silicium rekent — het is of het model in het geheugen past. OpenAI’s gepubliceerde tabel maakt concreet waar het om gaat (parameters en referentiegeheugen, gemeten op een server-GPU):

Whisper-variantParametersReferentiegeheugenRelatieve snelheid (A100)
tiny39 M~1 GB~10×
base74 M~1 GB~7×
small244 M~2 GB~4×
medium769 M~5 GB~2×
large1.550 M~10 GB
turbo809 M~6 GB~8×

Twee eerlijke kanttekeningen bij die tabel. De geheugen- en snelheidskolommen zijn OpenAI’s referentiecijfers voor GPU-inferentie — een telefoon heeft geen aparte VRAM-pool, en de apps die je feitelijk installeert kwantiseren de modellen voor Core ML, wat zowel het geheugengebruik als de doorvoer verandert. Lees de tabel dus als de verhouding tussen varianten, niet als een specificatieblad voor een telefoon. Maar juist die verhouding is het punt: een klein model past moeiteloos op een telefoon, een model uit de Large-familie alleen met serieus engineeringwerk — en daarom laden meerdere bekende iPhone-apps stilletjes small of medium, zelfs als hun desktopversie large draait. Whisper Large V3 Turbo — 809 miljoen parameters, met de decoder teruggebracht van 32 lagen naar 4 — bestaat precies om Large-nauwkeurigheid binnen dat budget te laten passen; waarom LoroNote dit model koos hebben we apart uitgelegd.

Verliest on-device transcriptie nauwkeurigheid?

Nee — en dit is het hardnekkigste misverstand erover. Modelgewichten zijn deterministische wiskunde: dezelfde variant levert op een telefoon dezelfde transcriptkwaliteit als op een server. On-device is geen uitgeklede stand.

Wat wél tussen apps verschilt, is welke variant ze laden, en dat verschil is groot — volgens gepubliceerde cijfers ligt het foutpercentage van Whispers kleine varianten op dezelfde benchmark ruwweg dubbel zo hoog als dat van engines uit de Large-familie. De nauwkeurigheidsvraag was dus nooit “cloud of apparaat?” De vraag is “welk model?” — en die stel je aan elke app afzonderlijk. De gemeten cijfers, van schone voorgelezen spraak tot vergaderzalen, staan in Hoe nauwkeurig is Whisper?

Hoe snel is het in de praktijk?

Eén cijfer hier is van onszelf, dus dat markeren we: op een iPhone 15 Pro transcribeert LoroNote op ruwweg 19× realtime — een opname van een uur wordt tekst in ongeveer drie minuten, volledig op het apparaat (LoroNote-meting, 13-08-2026). Ter vergelijking met een andere on-device engine: de benchmark van Apples iOS 26 SpeechAnalyzer rapporteerde een doorvoer van ruwweg 12–40× realtime op een desktop-M2 Pro — met belangrijke kanttekeningen bij wat die benchmark wel en niet testte.

Snelheid op het apparaat heeft één eigenschap die cloudsnelheid mist: die is helemaal van jou. Geen wachtrij, geen limiet, geen teller per minuut — het extra uur transcriberen kost batterij, geen factuur.

Wat on-device echt niet kan

Bij een eerlijke definitie horen ook de grenzen:

  • Het model wordt alleen beter wanneer de app wordt bijgewerkt. Een cloudaanbieder kan ‘s nachts aan de serverkant een beter model in gebruik nemen; een on-device app levert zijn model mee in de app, dus verbeteringen komen met app-updates — zichtbaar, niet stilletjes.
  • Grote batchklussen blijven om grote hardware vragen. Honderden uren transcriberen voor een onderzoeksarchief gaat sneller op een desktop-GPU of een betaalde cloudwachtrij dan op welke telefoon dan ook.
  • Alles wat in de kern met meerdere mensen tegelijk gebeurt, heeft een server nodig. Een live gedeeld transcript dat tien mensen tijdens een gesprek bewerken is coördinatie, geen transcriptie — wanneer een clouddienst nog steeds de juiste keuze is behandelt die gevallen.
  • Langdurig rekenen kost batterij. Transcriptie gebeurt één keer per opname en niet doorlopend, maar een lang bestand is echt werk voor de chip — de oplader erbij pakken voor een batch van drie uur is verstandig.

Geen van deze grenzen verandert de kern van de afweging: voor persoonlijke opnames — vergaderingen, colleges, interviews, notities — gebeurt het werk op hardware die je al bezit, met de nauwkeurigheid van het model dat je koos, zonder dat er iets het apparaat verlaat.

Veelgestelde vragen

Is on-device transcriptie echt privé?

De privacy-eigenschap zit in de architectuur: de pijplijn bevat geen uploadstap, dus er bestaat nergens een kopie van je audio die bewaard of gelekt kan worden. De architectuur controleer je zelf — zet de vliegtuigmodus aan en transcribeer. Wat dat feit betekent voor jouw eigen geheimhoudingsplichten is een afweging die alleen jij kunt maken; de technische claim is simpelweg dat de audio op de telefoon blijft.

Werkt on-device transcriptie offline?

Ja, dat volgt uit de opzet zelf — niets in de pijplijn heeft een netwerk nodig. Het model wordt één keer met de app gedownload; daarna werken opnemen en transcriberen in een kelder, in het vliegtuig of in vliegtuigmodus.

Is on-device transcriptie minder nauwkeurig dan cloudtranscriptie?

Niet vanwege de plek waar het draait — identieke modelgewichten leveren overal identieke kwaliteit. Nauwkeurigheidsverschillen tussen apps komen van de modelvariant die elke app laadt, en de geheugendruk van een telefoon is waarom sommige apps voor kleine varianten kiezen. Controleer de variant, niet de locatie.

Waarom draaien sommige iPhone-apps kleinere Whisper-modellen?

Geheugen. OpenAI’s referentietabel loopt van 39 miljoen tot 1,55 miljard parameters, en de grotere varianten vragen meerdere gigabytes nog vóórdat de beperkingen van een telefoon meespelen. Een Large-model passend maken voor een telefoon vergt gericht engineeringwerk — kwantisatie, Core ML-conversie, een snelheidsgeoptimaliseerde architectuur zoals Turbo’s decoder van vier lagen — en niet elke app investeert daarin.

Is Apples ingebouwde dicteerfunctie ook on-device AI-transcriptie?

Steeds vaker wel. Apples SpeechAnalyzer in iOS 26 draait volledig op het apparaat, net als een on-device Whisper-app — de verschillen zitten in bereik en voorwaarden: Apples engine ondersteunde in augustus 2026 22 talen tegenover ongeveer 100 voor Whisper, en hij vereist iOS 26. We vergeleken de twee engines in detail.

Vreet on-device transcriptie de batterij leeg?

Transcriptie is een korte piek van echt rekenwerk, geen sluipverbruik op de achtergrond — het draait wanneer je transcribeert en stopt zodra de tekst klaar is. Korte opnames merk je nauwelijks; behandel meerdere uren achter elkaar zoals elke andere zware klus en steek de stekker erin.

Tot slot over on-device AI-transcriptie

On-device AI-transcriptie is geen mindere kopie van een clouddienst; het is dezelfde wiskunde, uitgevoerd op silicium dat je al bezit. De definitie om te onthouden bestaat uit drie delen: voor je audio bestaat er geen uploadstap (controleerbaar in vliegtuigmodus), de nauwkeurigheid is een eigenschap van de modelvariant en niet van de locatie, en het geheugen van de telefoon — niet zijn snelheid — bepaalt welke variant een app aan boord kan hebben. Beoordeel elke on-device app op die laatste vraag, want het is de vraag die de marketing nooit beantwoordt.

Bronnen

Cijfers opnieuw gecontroleerd tegen de gelinkte bronnen op 27 augustus 2026.

Je stem wordt tekst — offline

LoroNote transcribeert vergaderingen, colleges en interviews direct op je iPhone — privé, nauwkeurig en onbeperkt.

Download in de App Store