IA

Quelle est la précision de Whisper ? Les vrais chiffres, du livre audio à la salle de réunion (2026)

Équipe LoroNote11 min

La précision réelle de Whisper : environ 2–3 % de taux d’erreur sur la parole propre, près de 7 % sur les benchmarks anglais mixtes, autour de 16 % en réunion.

Réponse rapide : il n’existe pas un chiffre unique de précision pour Whisper — il existe une échelle. Sur de la parole lue, propre, à une seule voix, les grands modèles atteignent environ 2–3 % de taux d’erreur sur les mots (WER), soit plus de 97 mots corrects sur 100. Sur un mélange de benchmarks anglais réels, Whisper Large V3 tourne en moyenne autour de 7,4 % de WER. Sur de l’audio de réunion, micros éloignés et voix qui se chevauchent, le même modèle est autour de 16 %. Et sur les langues peu dotées, le taux d’erreur peut encore tripler. Que Whisper soit « précis » dépend du barreau où se trouve votre enregistrement — et, tout autant, de la variante de Whisper que l’app que vous utilisez exécute réellement.

Chaque chiffre de cet article provient de l’article de recherche publié par OpenAI et des fiches de modèle, ou du classement public Open ASR Leaderboard, en lien dans les sources à la fin. Rédigé par l’équipe LoroNote le 19 août 2026. LoroNote exécute Whisper Large V3 Turbo sur l’appareil : nous avons donc un intérêt en jeu — et c’est précisément pourquoi rien ci-dessous n’est un chiffre marketing maison.

Ce que mesure vraiment le taux d’erreur sur les mots

Le WER compte les mots qu’une transcription a ratés — substitués, omis ou inventés — en proportion des mots prononcés. Un WER de 5 % signifie une erreur tous les 20 mots ; 16 %, une sur six. Deux choses découlent de la définition :

  1. Un WER n’a de sens qu’au regard de l’audio sur lequel il a été mesuré. « Précis à 98 % » sans jeu de test nommé est un slogan, pas une mesure. Le même modèle produit plus de 97 % sur un livre audio et 84 % en salle de conférence sans que rien ne soit cassé.
  2. Toutes les erreurs ne coûtent pas pareil. Un « euh » avalé et un nom de médicament erroné comptent chacun une fois. Le WER est l’étalon standard parce qu’il est objectif, pas parce qu’il capture l’utilisabilité ressentie d’une transcription — c’est pourquoi le test sur votre propre audio, décrit plus bas, bat n’importe quel tableau.

Nous détaillons la définition complète — la formule, pourquoi le WER peut dépasser 100 % et l’étape de normalisation qui déplace en silence les chiffres publiés — dans Qu’est-ce que le taux d’erreur de mots ?

L’échelle de précision : un modèle, quatre barreaux

Voici des chiffres publiés pour les grands modèles de Whisper sur des benchmarks standard :

Conditions audioBenchmarkWER approximatifSource
Parole lue propre, une seule voixLibriSpeech test-clean~2–3 %Article Whisper d’OpenAI (2,7 %, large)
Anglais réel mixte, huit jeux de testMoyenne Open ASR Leaderboard~7,4 % (Large V3)Open ASR Leaderboard
Salles de réunion, micros éloignés, voix croiséesCorpus de réunions AMI~16 % (Large V3)Open ASR Leaderboard
Exemple de langue peu dotéeHindi (Common Voice)~27 % (Large V3)Fiche de modèle openai/whisper-large-v3

Lisez l’échelle de haut en bas et le motif saute aux yeux : ce n’est pas le modèle qui se dégrade — c’est l’audio. La dictée dans un téléphone tenu près de la bouche se situe sur le barreau du haut. Un entretien par-dessus une table de café, au milieu. Une réunion enregistrée depuis le bout de la table est sur le troisième barreau, avant le moindre choix logiciel.

Quel Whisper ? La variante change la réponse

« Propulsé par Whisper » désigne une famille, pas un modèle. Whisper existe en tailles de tiny à large, et l’écart entre elles dépasse l’écart entre éditeurs :

  • Large V3 est le vaisseau amiral de la précision. OpenAI l’a entraîné sur 1 million d’heures d’audio faiblement étiqueté plus 4 millions d’heures d’audio pseudo-étiqueté, et rapporte 10 à 20 % d’erreurs en moins que Large V2 sur un large éventail de langues.
  • Large V3 Turbo est le dérivé optimisé pour la vitesse : 809 millions de paramètres, décodeur ramené de 32 à 4 couches. OpenAI décrit le coût comme une « dégradation mineure de la qualité » — sur l’Open ASR Leaderboard, les moyennes sont proches (environ 7,8 % contre 7,4 % de WER moyen ; environ 16,1 % contre 16,0 % sur AMI). Combiné sur l’ensemble des langues, il se comporte comme Large V2, et perd surtout dans quelques langues comme le thaï et le cantonais. Nous avons décortiqué ce compromis dans notre guide Whisper Large V3 Turbo.
  • Small et medium tournent plusieurs points de WER plus haut — un écart réel, visible dans un test d’un paragraphe. C’est particulièrement important sur iPhone : plusieurs « apps Whisper » connues exécutent small ou medium sur le téléphone, même quand leurs versions Mac exécutent large. Notre comparatif des apps Whisper liste la variante que chaque app iOS charge réellement.

La règle pratique : avant de comparer des apps sur la précision, vérifiez quel Whisper chacune exécute. Une app qui exécute Large V3 Turbo et une app qui exécute small n’offrent pas la même précision, quoi que disent leurs fiches sur « l’IA Whisper ».

La langue déplace le chiffre plus que tout le reste côté logiciel

Les données d’entraînement de Whisper penchent fortement vers les langues bien dotées, et la précision suit. L’anglais, l’espagnol, l’allemand, le japonais, le coréen et les autres langues bien représentées se regroupent près des moyennes ci-dessus. Les langues peu dotées sont bien plus haut — le chiffre du hindi dans le tableau en est un exemple publié, et la fiche de modèle d’OpenAI note aussi des performances inégales selon les accents et dialectes à l’intérieur d’une même langue.

Whisper Large V3 couvre une centaine de langues (le cantonais a été ajouté avec V3) : « prise en charge » et « précision égale » sont donc deux affirmations différentes. Si votre langue est hors du peloton bien doté, le conseil honnête est le même que partout dans cet article : passez un court enregistrement à vous et regardez le résultat — la liste complète des langues dit ce que LoroNote tentera, et deux minutes de votre propre audio disent avec quelle qualité.

Les hallucinations : l’erreur que le WER sous-estime

La fiche de modèle d’OpenAI le dit sans détour : parce que les modèles sont entraînés sur de grandes données bruitées, « les prédictions peuvent inclure des textes qui ne sont pas réellement prononcés dans l’audio (c.-à-d. une hallucination) ». En pratique, cela apparaît sur le silence, le bruit de fond et la musique — Whisper est un modèle génératif, et quand aucune parole ne l’ancre, il peut produire des phrases fluides que personne n’a dites.

Deux choses gardent cela maîtrisable :

  • Les apps peuvent l’atténuer. Une détection d’activité vocale qui saute les passages silencieux retire au modèle sa principale occasion d’inventer du texte. C’est un comportement au niveau de l’app, pas un réglage du modèle — et l’une des vraies différences entre des apps exécutant le même Whisper.
  • Vous pouvez le repérer. Le texte halluciné apparaît typiquement sur des passages que vous savez silencieux — la fin d’un enregistrement, une longue pause. Si le cœur d’une transcription est solide mais que ses silences ont fait pousser des phrases, vous regardez une hallucination, pas une mauvaise écoute.

Nous avons comparé ce comportement à un modèle à architecture transducteur dans Parakeet V3 vs Whisper Large V3 — les transducteurs hallucinent moins sur le silence, tandis que Whisper couvre bien plus de langues ; rien n’est gratuit.

Ce qui déplace vraiment la précision sur vos enregistrements

Les benchmarks font varier l’audio ; vos enregistrements font varier les mêmes choses. Par ordre d’impact approximatif :

  1. La distance du micro. Le levier numéro un. Un téléphone à portée de bras sur la table bat un téléphone à l’autre bout de la pièce plus nettement que n’importe quelle montée en gamme de modèle.
  2. Le bruit et la musique. Un bruit de fond régulier dégrade en douceur ; la musique et les cliquetis dégradent brutalement.
  3. Les voix qui se chevauchent. Les prises de parole croisées sont la raison pour laquelle les corpus de réunion sont à ~16 % quand l’audio à une voix est à ~3 %.
  4. Le vocabulaire spécialisé. Noms propres, médicaments, codes boursiers et jargon échouent de manière disproportionnée. Le dictionnaire personnalisé de LoroNote existe exactement pour cela : les termes récurrents qu’il doit cesser de rater.
  5. La variante du modèle — le seul facteur ci-dessus qui soit un pur choix logiciel, et la raison pour laquelle LoroNote exécute la plus grande variante de Whisper praticable sur un téléphone.

Les étiquettes d’intervenants méritent une note : la diarisation ne change pas le WER, mais elle décide si une transcription à plusieurs voix est utilisable tout court. Une transcription précise sans intervenants reste du travail à faire ; le fonctionnement de l’identification des intervenants couvre cette moitié du problème.

Mesurez vous-même la précision de Whisper en dix minutes

Un test sur votre propre audio surclasse tous les tableaux de cet article :

  1. Enregistrez environ deux minutes qui ressemblent à votre usage réel — même pièce, même distance, même langue, vrais noms et vrai jargon. Deux minutes de parole font plus de 250 mots — assez pour le comptage ci-dessous.
  2. Transcrivez, puis comparez le résultat à l’audio.
  3. Comptez les erreurs sur un passage de 200 mots : chaque mot substitué, manquant ou inventé. Erreurs ÷ 200 = votre WER.
  4. Jugez les erreurs, pas seulement leur nombre : cinq mots de remplissage écorchés et cinq noms de clients écorchés donnent le même WER — et une journée très différente.

La version précise de cette méthode — y compris comment décider d’avance de ce qui compte comme une erreur — se trouve dans notre guide du WER.

Ce test ne coûte rien : la version gratuite de LoroNote transcrit les deux premières minutes de chaque enregistrement — exactement assez pour ce test. Et comme LoroNote transcrit sur l’appareil, l’enregistrement ne quitte jamais votre iPhone — pas d’étape d’envoi, pas de compte, et le mode Avion ne change rien.

Questions fréquentes

Whisper est-il assez précis pour des transcriptions professionnelles ?

Pour des enregistrements propres, au micro proche, dans des langues bien dotées, les grands modèles de Whisper produisent des brouillons que la plupart des gens ne retouchent que légèrement — les 2–3 % de WER sur la parole propre frôlent le plafond pratique des systèmes automatiques. Pour des réunions au micro lointain, beaucoup de voix croisées ou un mot-à-mot critique, prévoyez du temps de relecture : à 16 % de WER, un mot sur six réclame votre attention.

Whisper Large V3 Turbo perd-il en précision par rapport à Large V3 ?

Légèrement. OpenAI qualifie la dégradation de mineure, et les moyennes publiques du classement se tiennent à bien moins d’un point en anglais. Combiné sur l’ensemble des langues, Turbo se comporte comme Large V2, avec les pertes les plus fortes dans quelques langues comme le thaï et le cantonais. En échange, il est spectaculairement plus rapide — le compromis qui rend un modèle de série Large praticable sur un téléphone.

Pourquoi ma transcription contient-elle des phrases que personne n’a dites ?

C’est une hallucination, un comportement documenté de Whisper sur le silence, le bruit et la musique : un modèle génératif sans parole pour l’ancrer peut produire du texte fluide quand même. Vérifiez les passages silencieux de votre enregistrement. Les apps qui exécutent une détection d’activité vocale avant Whisper l’évitent en grande partie — c’est un comportement d’app, pas un réglage utilisateur.

Exécuter Whisper sur l’appareil réduit-il sa précision ?

Non. Les mêmes poids de modèle produisent la même qualité de transcription où qu’ils s’exécutent ; l’inférence locale n’est pas un mode dégradé. Ce qui diffère entre les apps, c’est la variante exécutée — les services cloud hébergent sans peine les plus grands modèles, tandis que les apps locales doivent tenir dans le téléphone, d’où le choix de small ou medium chez certaines. LoroNote exécute Large V3 Turbo localement, réunissant un modèle de série Large et la confidentialité locale dans la même app.

Conclusion

« Quelle est la précision de Whisper » a une forme, pas un chiffre : environ 2–3 % de WER sur la parole lue propre, près de 7 % sur les benchmarks anglais mixtes, autour de 16 % sur l’audio de réunion — et pire sur les langues peu dotées, avec l’hallucination comme réserve que le WER sous-estime. Les deux choix qui déplacent le plus vos propres résultats sont l’un physique (rapprocher le micro), l’autre structurel (savoir quelle variante de Whisper votre app exécute). Le reste se mesure en dix minutes avec votre propre enregistrement — le seul benchmark qui ait jamais parlé de vous.

Ressources officielles

Votre voix devient du texte — hors ligne

LoroNote transcrit réunions, cours et interviews directement sur votre iPhone — privé, précis et illimité.

Télécharger sur l’App Store