
Risposta rapida: nel benchmark che tutti hanno condiviso, il nuovo SpeechAnalyzer on-device di Apple ha davvero battuto Whisper — 2,12% di tasso di errore sulle parole contro 3,74% su LibriSpeech test-clean. Solo che quel test ha eseguito Whisper Small, su audiolibri in inglese, su un Mac. Non ha mai testato Whisper Large V3 né Large V3 Turbo, cioè i modelli che un’app on-device carica davvero su iPhone, e non ha toccato né una riunione, né un accento, né una delle circa 99 altre lingue di Whisper. Il motore di Apple è veloce, accurato e gratuito, all’interno delle 22 lingue che supporta. Whisper ne copre circa cinque volte tante.
Tutti i numeri qui sotto vengono dall’articolo dell’autore del benchmark, dai paper e dalle schede modello pubblicate da OpenAI, dalla Open ASR Leaderboard o dalla documentazione per sviluppatori di Apple: tutto è collegato in fondo. Il testo è stato scritto dal team di LoroNote il 23 agosto 2026. LoroNote esegue Whisper Large V3 Turbo sul dispositivo, quindi in questo confronto abbiamo un interesse. È esattamente per questo che ogni cifra riportata qui è la misurazione di qualcun altro, non la nostra.
Cos’è davvero SpeechAnalyzer
SpeechAnalyzer è il framework vocale che Apple ha presentato alla WWDC 2025 e distribuito con iOS 26. Sostituisce SFSpeechRecognizer, l’API ormai datata che per un decennio ha retto quasi tutta la dettatura di terze parti su iOS.
Contano due moduli pubblici:
SpeechTranscriberconverte il parlato in testo.SpeechDetectorindividua dove c’è parlato in un flusso audio.
Tutto viene eseguito sul dispositivo. Le risorse linguistiche si scaricano dal catalogo di sistema invece di essere incluse in ogni app, ed è per questo che un’app che usa questa API non aumenta quasi per nulla la dimensione del download. Per le lingue che SpeechTranscriber non copre, Apple mette a disposizione DictationTranscriber come ripiego.
C’è un requisito rigido che quasi tutti i confronti saltano: SpeechAnalyzer richiede iOS 26 o successivo e non è retrocompatibile. Su un iPhone rimasto a iOS 18 semplicemente non esiste.
Il benchmark che tutti hanno citato
I numeri che a luglio 2026 hanno fatto il giro della stampa tecnologica vengono da una singola valutazione condotta da uno sviluppatore. Ecco cosa ha misurato davvero:
| Condizione | Valore |
|---|---|
| Corpus | LibriSpeech — 5.559 enunciati (2.620 test-clean, 2.939 test-other) |
| Audio | Parlato letto da audiolibro, un solo interlocutore, registrazione pulita |
| Lingua | solo inglese |
| Hardware | M2 Pro, 32 GB, macOS 26.5.1, tutto sul dispositivo |
| Varianti di Whisper testate | Tiny, Base, Small |
E i risultati:
| Motore | WER test-clean | WER test-other |
|---|---|---|
| Apple SpeechAnalyzer | 2,12% | 4,56% |
| Whisper Small (~460 MB) | 3,74% | 7,95% |
| Whisper Base (~140 MB) | 5,42% | 12,51% |
| Whisper Tiny (~40 MB) | 7,88% | 17,04% |
| SFSpeechRecognizer (vecchio) | 9,02% | 16,25% |
Su questa tabella vanno dette due cose senza giri di parole. Il distacco di Apple dalla propria vecchia API è enorme — circa il 75% di errori in meno, ed è questa la vera notizia per chi aveva costruito su SFSpeechRecognizer. E Apple ha effettivamente battuto tutti i modelli Whisper testati.
Il problema è quali modelli sono stati testati.
Tre cose che il benchmark non ha misurato
1. I modelli Whisper che le app on-device eseguono davvero
Whisper Small è un modello da 460 MB. Non è quello che un’app di trascrizione seria carica su un iPhone recente. LoroNote esegue Large V3 Turbo: 809 milioni di parametri, con il decoder ridotto da 32 livelli a 4 per guadagnare velocità.
Il benchmark si è fermato prima di Medium, Large e Turbo. Per dare la scala, valutazioni pubblicate collocano Whisper Large V3 su LibriSpeech intorno al 2,0–2,5% di WER su test-clean e al 3,9–4,3% su test-other, cioè nella stessa zona del 2,12% e 4,56% di Apple, o leggermente meglio.
Prendi questo confronto con cautela. Quei numeri di Whisper vengono da valutazioni separate, ciascuna con la propria normalizzazione del testo, non da uno scontro diretto sulla stessa macchina contro il motore di Apple. La sola scelta della normalizzazione può spostare il WER di LibriSpeech di più di un punto — la nostra guida al WER spiega come succede. La conclusione onesta non è «Whisper Large vince». È che nessun test pubblicato ha confrontato il motore di Apple con i modelli Whisper di cui si sta davvero parlando, e che il divario suggerito dai titoli è un effetto della dimensione di modello scelta.
2. Qualsiasi cosa più difficile di un audiolibro da studio
LibriSpeech è parlato letto: una persona, un libro, un buon microfono, nessuna sovrapposizione. È il gradino più basso della scala, ed è proprio lì che ogni motore mette a segno il suo risultato migliore.
Le registrazioni reali stanno più in alto. Sulla scala di accuratezza che abbiamo documentato per Whisper, lo stesso Large V3 che segna 2–3% sul parlato letto pulito ha una media intorno al 7,4% su un insieme di benchmark inglesi reali e sta sul 16% circa sull’audio di sala riunioni AMI, con microfoni lontani e voci sovrapposte.
Per SpeechAnalyzer questi gradini non li ha pubblicati nessuno. Finché resta così, un 2,12% su audiolibro dice pochissimo su una riunione a quattro registrata dal centro del tavolo. L’autore del benchmark è stato esplicito su questo: il testo descrive il corpus come «parlato letto da audiolibro, non riunioni».
3. Altre novantanove lingue
È la lacuna più grande, e l’autore l’ha segnalata direttamente: quei numeri «non dicono nulla sulle oltre 100 lingue supportate da Whisper».
Ad agosto 2026, SpeechTranscriber.supportedLocales restituisce 42 varianti regionali che coprono 22 lingue:
arabo, cantonese, cinese (semplificato, tradizionale, Hong Kong), coreano, danese, ebraico, finlandese, francese, giapponese, inglese (nove varianti regionali), italiano, malese, norvegese (bokmål), olandese, portoghese, russo, spagnolo, svedese, tedesco, thailandese, turco e vietnamita.
Whisper Large V3 ne copre un centinaio. Le assenze nella lista di Apple non sono casi marginali: manca l’hindi, manca il polacco, manca il ceco, manca il greco, manca l’ucraino, manca l’indonesiano. Il portoghese esiste solo come pt_BR, non c’è la variante europea.
Per chi legge in italiano il punto chiave è un altro. it_IT e it_CH sono entrambi nella lista di Apple, quindi il supporto non è il problema. Il problema è che per l’italiano non esistono cifre di accuratezza pubblicate per nessuno dei due motori. Il benchmark tanto citato ha misurato solo l’inglese e Apple non pubblica il WER per lingua. Sostenere oggi che Apple trascriva l’italiano meglio di Whisper, o il contrario, significa parlare senza basi. Due minuti di una tua registrazione restano la fonte più solida.
Apple ha dichiarato che arriveranno altre lingue, quindi questo elenco prima o poi sarà superato. Ma «supportata» e «altrettanto accurata» restano due affermazioni diverse per entrambi i motori. Per questo conviene mettere alla prova l’elenco completo delle lingue con il tuo audio invece di fidarti di un conteggio.
A proposito del «tre volte più veloce»
L’affermazione sulla velocità ha viaggiato quanto quella sull’accuratezza, e ha la stessa nota a piè di pagina: è stata misurata contro Whisper Small.
Quello che il benchmark ha riportato è un intervallo di throughput di circa 12–40 volte il tempo reale su un M2 Pro: un’ora di audio in circa 1,5–5 minuti. L’autore ha volutamente trattenuto i tempi precisi per modello in attesa di misurazioni più pulite a macchina scarica.
L’intervallo è reale e il motore di Apple è veloce. Viene però da un chip M da scrivania con 32 GB di RAM, non da un telefono. Su iPhone il vincolo che conta per qualsiasi modello di trascrizione è la memoria, non la potenza di calcolo pura. È anche il motivo per cui diverse «app Whisper» note caricano in silenzio small o medium sul telefono mentre le versioni per Mac eseguono large. Abbiamo raccolto quale variante carica davvero ogni app iOS.
Quando conviene l’uno e quando l’altro
Nessuno dei due vince in assoluto. Sono costruiti per lavori diversi.
Scegli Apple SpeechAnalyzer se:
- la tua lingua è tra le 22 supportate, soprattutto se è l’inglese;
- il tuo dispositivo è su iOS 26 o successivo;
- vuoi trascrizione dal vivo, con risultati parziali che si aggiornano mentre qualcuno parla: l’API è pensata per questo;
- non vuoi né download di modelli né costi.
Scegli la famiglia Whisper Large V3 se:
- la tua lingua è fuori dall’elenco di Apple, oppure le tue registrazioni mescolano lingue in uno stesso file;
- ti serve lo stesso comportamento su dispositivi più vecchi: le app basate su Whisper girano ben al di sotto di iOS 26;
- stai trascrivendo file già registrati invece di parlato dal vivo, dove l’accuratezza conta più della latenza;
- vuoi che la trascrizione risulti identica indipendentemente dalla versione del sistema.
Non ci sono pasti gratis in nessuna direzione. Il motore di Apple si integra più in fretta, non costa nulla ed è eccellente nel suo raggio d’azione. Il raggio di Whisper è circa cinque volte più ampio, e le varianti Large pagano quell’ampiezza in dimensione del modello e tempo di elaborazione.
Cosa cambia quando scegli un’app per iPhone
Due conseguenze pratiche.
Primo: «trascrizione IA» sull’App Store ormai indica almeno tre cose diverse. Un’app che chiama lo SpeechAnalyzer on-device di Apple, un’app che esegue localmente un proprio modello Whisper, oppure un’app che carica il tuo audio su un server. Privacy, funzionamento offline e copertura linguistica sono completamente diversi, e le schede raramente lo dicono. Il nostro confronto delle app iOS di sintesi vocale in testo le ordina in base a dove viene elaborato l’audio.
Secondo: che un’app sia «on-device» non dice più nulla sull’accuratezza. Entrambe le strade sono locali. La domanda si è spostata da dove va il mio audio a quale modello, di quale dimensione, in quale lingua.
Provalo tu in cinque minuti
I benchmark sono medie su corpora che non registrerai mai. Il tuo audio è l’unico test che risponde alla tua domanda:
- Registra due minuti nella stanza in cui registri di solito: il tuo microfono, il tuo accento, qualche nome proprio, numero e termine tecnico.
- Trascrivilo con la trascrizione integrata dell’iPhone (Memo Vocali su un dispositivo compatibile, oppure un’app che usa il motore di Apple).
- Trascrivi lo stesso file con un’app basata su Whisper.
- Conta gli errori su un tratto di 200 parole: ogni parola sostituita, mancante o inventata. Errori ÷ 200 = il tuo WER. (Il metodo completo, incluso come decidere cosa conta come errore, è nella nostra guida al WER.)
Se entrambe escono pulite, usa quella più comoda. La differenza salta fuori di solito sui nomi propri, sul parlato sovrapposto e su qualsiasi lingua fuori dal gruppo meglio servito, cioè esattamente dove il benchmark ha smesso di guardare.
Domande frequenti
Apple SpeechAnalyzer è più accurato di Whisper?
Contro Whisper Small su audiolibri inglesi puliti sì: 2,12% contro 3,74% di WER. Contro Whisper Large V3 o Large V3 Turbo nessuno ha pubblicato un test diretto. Valutazioni separate mettono Large V3 alla pari o leggermente avanti sullo stesso corpus, ma normalizzazioni diverse ne fanno un confronto approssimativo, non un verdetto.
Quale è più accurato in italiano?
Non ci sono cifre pubblicate. Il benchmark più citato ha misurato solo l’inglese e Apple non diffonde il WER per lingua. it_IT e it_CH sono nella lista di Apple, quindi il supporto c’è. Per l’accuratezza, il test con due minuti di registrazione tua è oggi l’unico metodo affidabile.
SpeechAnalyzer funziona offline?
Sì. Gira interamente sul dispositivo e le risorse linguistiche si scaricano una volta dal catalogo di sistema. Da questo punto di vista è come un’app Whisper locale: nessuna delle due manda il tuo audio a un server.
Serve iOS 26?
Sì. SpeechAnalyzer richiede iOS 26 o successivo e non è retrocompatibile. Le app basate su Whisper funzionano su versioni parecchio più vecchie, ed è una delle ragioni pratiche per tenere presenti entrambi i motori.
Uno dei due riconosce chi sta parlando?
L’identificazione degli interlocutori è un passaggio separato dalla trascrizione, e nessuno dei due motori la esegue come parte del riconoscimento vocale. Sono le app ad aggiungerla sopra — come funziona la separazione degli interlocutori spiega cosa comporta e dove si rompe.
Perché LoroNote usa Whisper invece del motore di Apple?
Per copertura linguistica e copertura dei dispositivi. LoroNote trascrive circa 100 lingue, incluse registrazioni con lingue miste, su dispositivi ben precedenti a iOS 26. Il motore di Apple è eccellente all’interno delle sue 22 lingue, ma non sostituisce quell’ampiezza. La scelta del modello è spiegata nella nostra guida a Whisper Large V3 Turbo.
Fonti
- Apple, Bring advanced speech-to-text to your app with SpeechAnalyzer — sessione WWDC25 di presentazione del framework
- Apple, documentazione di SpeechTranscriber
- Lyonesse, Apple’s New Speech API vs Whisper: The First Real Benchmark — la valutazione su LibriSpeech, la sua metodologia e i limiti dichiarati
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — il paper di Whisper
- OpenAI, scheda del modello whisper-large-v3 e scheda del modello whisper-large-v3-turbo
- Open ASR Leaderboard — cifre dei benchmark misti e dell’audio di riunione AMI
Cifre del benchmark verificate il 23 agosto 2026. L’elenco delle lingue supportate da Apple cambia con gli aggiornamenti di sistema: verifica SpeechTranscriber.supportedLocales su una build recente prima di farci affidamento.
La tua voce diventa testo — offline
LoroNote trascrive riunioni, lezioni e interviste direttamente sul tuo iPhone — privato, preciso e illimitato.
Scarica dall’App Store