IA

Quanto è accurato Whisper? Numeri reali, dagli audiolibri alle sale riunioni (2026)

Team LoroNote10 min

L'accuratezza reale di Whisper: circa 2–3% di WER sul parlato pulito, ~7% sui benchmark inglesi misti, ~16% in sala riunioni — e cosa sposta di più quei numeri.

Risposta rapida: non esiste un unico numero di accuratezza per Whisper — esiste una scala. Sul parlato letto, pulito e con un solo interlocutore, i modelli large raggiungono all’incirca il 2–3% di tasso di errore sulle parole (WER), cioè più di 97 parole corrette su 100. Su un insieme di benchmark inglesi reali, Whisper Large V3 si attesta in media intorno al 7,4% di WER. Sull’audio di sala riunioni, con microfoni distanti e voci sovrapposte, lo stesso modello viaggia intorno al 16%. E sulle lingue a basse risorse il tasso di errore può triplicare di nuovo. Che Whisper sia “accurato” dipende dal gradino su cui si trova la tua registrazione — e, in pari misura, da quale variante di Whisper l’app che usi esegue davvero.

Ogni numero di questo articolo proviene dal paper pubblicato da OpenAI, dalle schede dei modelli o dalla Open ASR Leaderboard pubblica, linkate nelle fonti alla fine. È stato scritto dal team LoroNote il 19 agosto 2026. LoroNote esegue Whisper Large V3 Turbo sul dispositivo, quindi qui abbiamo un interesse in gioco — ed è esattamente per questo che nulla di ciò che segue è una nostra cifra di marketing.

Che cosa misura davvero il tasso di errore sulle parole

Il WER conta le parole che una trascrizione ha sbagliato — sostituite, omesse o inventate — come quota delle parole pronunciate. Un WER del 5% significa un errore ogni 20 parole; il 16% significa uno ogni sei. Dalla definizione seguono due cose:

  1. Un WER significa qualcosa solo accanto all’audio su cui è stato misurato. “Accurato al 98%” senza un test set nominato è uno slogan, non una misura. Lo stesso modello produce oltre il 97% su un audiolibro e l’84% in una sala conferenze senza che nulla sia andato storto.
  2. Non tutti gli errori costano allo stesso modo. Un “ehm” perso e il nome sbagliato di un farmaco contano una volta ciascuno. Il WER è il metro standard perché è oggettivo, non perché catturi quanto una trascrizione risulti usabile — ed è per questo che il test sul tuo audio, descritto più avanti, batte qualsiasi tabella.

Analizziamo la definizione completa — la formula, perché il WER può superare il 100% e il passaggio di normalizzazione che sposta in silenzio i numeri pubblicati — in Cos’è il word error rate?

La scala dell’accuratezza: un modello, quattro gradini

Queste sono cifre pubblicate per i modelli large di Whisper su benchmark standard:

Condizioni audioBenchmarkWER approssimativoFonte
Parlato letto pulito, un solo interlocutoreLibriSpeech test-clean~2–3%Paper Whisper di OpenAI (2,7%, large)
Audio inglese reale misto, otto test setMedia Open ASR Leaderboard~7,4% (Large V3)Open ASR Leaderboard
Sale riunioni, microfoni distanti, voci accavallateCorpus di riunioni AMI~16% (Large V3)Open ASR Leaderboard
Esempio di lingua a basse risorseHindi (Common Voice)~27% (Large V3)Scheda del modello openai/whisper-large-v3

Leggi la scala dall’alto in basso e lo schema è evidente: non è il modello a peggiorare — è l’audio. La dettatura in un telefono tenuto vicino alla bocca sta vicino al gradino più alto. Un’intervista al tavolino di un bar sta nel mezzo. Una riunione registrata dall’altro capo del tavolo sta sul terzo gradino, prima ancora di qualsiasi scelta software.

Quale Whisper? La variante cambia la risposta

“Basato su Whisper” indica una famiglia, non un modello. Whisper esiste in diverse taglie, da tiny a large, e il divario fra una taglia e l’altra è più grande del divario fra i fornitori:

  • Large V3 è l’ammiraglia dell’accuratezza. OpenAI l’ha addestrato su 1 milione di ore di audio etichettato debolmente più 4 milioni di ore di audio pseudo-etichettato, e riporta il 10–20% di errori in meno rispetto a Large V2 su un’ampia gamma di lingue.
  • Large V3 Turbo è il derivato ottimizzato per la velocità: 809 milioni di parametri, con il decoder ridotto da 32 a 4 layer. OpenAI descrive il costo come un “lieve degrado di qualità” — sulla Open ASR Leaderboard le medie sono vicine (circa 7,8% contro 7,4% di WER medio; circa 16,1% contro 16,0% su AMI). Combinato su tutte le lingue si comporta in modo simile a Large V2, e perde di più in alcune lingue come thailandese e cantonese. Abbiamo smontato questo compromesso nella nostra guida a Whisper Large V3 Turbo.
  • Small e medium girano diversi punti di WER più in alto — un divario reale, visibile in un test di un paragrafo. Sugli iPhone questo conta in modo particolare, perché diverse note “app Whisper” eseguono small o medium sul telefono anche quando le loro versioni Mac eseguono large. Il nostro confronto delle app Whisper elenca quale variante carica davvero ciascuna app iOS.

La regola pratica: prima di confrontare le app sull’accuratezza, controlla quale Whisper esegue ciascuna. Un’app che esegue Large V3 Turbo e una che esegue small non offrono la stessa accuratezza, qualunque cosa dicano entrambe le schede su “Whisper AI”.

La lingua sposta il numero più di qualsiasi altra scelta software

I dati di addestramento di Whisper sono fortemente sbilanciati verso le lingue ad alte risorse, e la sua accuratezza li segue. Inglese, spagnolo, tedesco, giapponese, coreano e altre lingue ben rappresentate si raggruppano vicino alle medie qui sopra. Le lingue a basse risorse stanno molto più in alto — la cifra dell’hindi in tabella è un esempio pubblicato, e la scheda del modello di OpenAI segnala prestazioni disomogenee anche fra accenti e dialetti dentro le stesse lingue.

Whisper Large V3 copre circa 100 lingue (il cantonese è stato aggiunto con V3), quindi “supportata” e “ugualmente accurata” sono affermazioni diverse. Se la tua lingua è fuori dalla fascia ad alte risorse, il consiglio onesto è lo stesso di tutto questo articolo: fai girare una tua breve registrazione e guarda il risultato — l’elenco completo delle lingue ti dice cosa LoroNote tenterà, e due minuti del tuo audio ti dicono quanto bene.

Allucinazioni: l’errore che il WER sottostima

La scheda del modello di OpenAI lo dichiara apertamente: poiché i modelli sono addestrati su dati rumorosi su larga scala, “le predizioni possono includere testi che non sono stati effettivamente pronunciati nell’audio in ingresso (ossia allucinazione)”. In pratica questo emerge su silenzio, rumore di fondo e musica — Whisper è un modello generativo e, quando non c’è parlato ad ancorarlo, può produrre frasi scorrevoli che nessuno ha detto.

Due cose lo tengono gestibile:

  • Le app possono mitigarlo. Un rilevamento dell’attività vocale che salta i tratti silenziosi toglie al modello la sua principale occasione di inventare testo. È un comportamento a livello di app, non un’impostazione del modello, ed è una delle differenze reali fra app che eseguono lo stesso Whisper.
  • Puoi riconoscerlo. Il testo allucinato tende a comparire nei tratti che sai essere stati silenziosi — la fine di una registrazione, una lunga pausa. Se il centro di una trascrizione è solido ma nei silenzi sono spuntate frasi, stai guardando un’allucinazione, non un fraintendimento.

Abbiamo confrontato questo comportamento con un modello ad architettura transducer in Parakeet V3 vs Whisper Large V3 — i transducer allucinano meno sul silenzio, mentre Whisper copre molte più lingue; non esistono pasti gratis.

Cosa sposta davvero l’accuratezza sulle tue registrazioni

I benchmark variano l’audio; le tue registrazioni variano le stesse cose. In ordine approssimativo di impatto:

  1. Distanza del microfono. La leva singola più grande. Un telefono a portata di braccio sul tavolo batte un telefono dall’altra parte della stanza più di qualsiasi upgrade di modello.
  2. Rumore e musica. Il rumore di fondo costante fa danni contenuti; musica e stoviglie che sbattono fanno molto peggio.
  3. Voci sovrapposte. Le voci che si accavallano sono il motivo per cui i corpus di riunioni stanno al ~16% mentre l’audio a voce singola sta al ~3%.
  4. Lessico specialistico. Nomi, farmaci, ticker e gergo falliscono in modo sproporzionato. Il dizionario personalizzato di LoroNote esiste esattamente per questo: termini ricorrenti che deve smettere di sbagliare.
  5. La variante del modello — l’unico fattore qui sopra che è puramente una scelta software, ed è il motivo per cui LoroNote esegue la più grande variante di Whisper praticabile sul telefono.

Le etichette degli interlocutori meritano una nota: la diarizzazione non cambia il WER, ma cambia se una trascrizione a più voci sia usabile o meno. Una trascrizione accurata senza interlocutori resta comunque lavoro da rifare a mano; come funziona l’identificazione degli interlocutori copre quella metà del problema.

Come misurare da solo l’accuratezza di Whisper in dieci minuti

Un test sul tuo audio vale più di ogni tabella di questo articolo:

  1. Registra circa due minuti che somiglino al tuo uso reale — stessa stanza, stessa distanza, stessa lingua, nomi e gergo veri. Due minuti di parlato superano le 250 parole: bastano per il conteggio del passo 3.
  2. Trascrivilo e leggi il risultato confrontandolo con l’audio.
  3. Conta gli errori in un tratto di 200 parole: ogni parola sostituita, mancante o inventata. Errori ÷ 200 = il tuo WER.
  4. Giudica gli errori, non solo il conteggio: cinque intercalari storpiati e cinque nomi di clienti storpiati sono lo stesso WER, ma due giornate molto diverse.

La versione precisa di questo metodo — incluso come decidere in anticipo cosa conta come errore — è nella nostra guida al WER.

Poiché LoroNote trascrive sul dispositivo e la versione gratuita trascrive i primi due minuti di ogni registrazione — esattamente quanto serve per questo test — la prova non costa nulla, e la registrazione non lascia mai il tuo iPhone: non c’è caricamento, non c’è account, e la modalità Aereo non cambia niente.

Domande frequenti

Whisper è abbastanza accurato per trascrizioni professionali?

Per registrazioni pulite, con microfono vicino e in lingue ad alte risorse, i modelli large di Whisper producono bozze che la maggior parte delle persone ritocca appena — il 2–3% di WER sul parlato pulito è vicino al tetto pratico dei sistemi automatici. Per riunioni con microfono distante, molte voci accavallate o formulazioni esatte critiche, metti in conto tempo di revisione: al 16% di WER, una parola su sei richiede la tua attenzione.

Whisper Large V3 Turbo perde accuratezza rispetto a Large V3?

Leggermente. OpenAI definisce il degrado lieve, e le medie delle classifiche pubbliche distano ben meno di un punto in inglese. Combinato su tutte le lingue, Turbo si comporta in modo simile a Large V2, con le perdite maggiori in alcune lingue come thailandese e cantonese. In cambio è drasticamente più veloce — lo scambio che rende praticabile un modello della serie Large su un telefono.

Perché la mia trascrizione contiene frasi che nessuno ha detto?

È l’allucinazione, un comportamento documentato di Whisper su silenzio, rumore e musica: un modello generativo senza parlato ad ancorarlo può produrre comunque testo scorrevole. Controlla i tratti silenziosi della tua registrazione. Le app che eseguono il rilevamento dell’attività vocale prima di Whisper la evitano in gran parte — è un comportamento dell’app, non un’impostazione utente.

Eseguire Whisper sul dispositivo ne riduce l’accuratezza?

No. Gli stessi pesi del modello producono la stessa qualità di trascrizione ovunque girino; l’inferenza on-device non è una modalità degradata. Ciò che cambia fra le app è quale variante eseguono — i servizi cloud ospitano facilmente i modelli più grandi, mentre le app on-device devono stare nel telefono, ed è per questo che alcune eseguono small o medium. LoroNote esegue Large V3 Turbo in locale, tenendo un modello della serie Large e la privacy on-device nella stessa app.

Conclusione

“Quanto è accurato Whisper” ha una forma, non un numero: all’incirca 2–3% di WER sul parlato letto pulito, circa il 7% sui benchmark inglesi misti, intorno al 16% sull’audio di riunione, e peggio sulle lingue a basse risorse — con l’allucinazione come avvertenza che il WER sottostima. Le due scelte che spostano di più i tuoi risultati sono una fisica (avvicina il microfono) e una strutturale (sapere quale variante di Whisper esegue la tua app). Il resto si misura in dieci minuti con una tua registrazione, che è l’unico benchmark che ti riguardi davvero.

Risorse ufficiali

La tua voce diventa testo — offline

LoroNote trascrive riunioni, lezioni e interviste direttamente sul tuo iPhone — privato, preciso e illimitato.

Scarica dall’App Store