Guide

Améliorer la précision de la transcription : cinq leviers (2026)

LoroNote Team13 min

La plupart des conseils sur la précision de transcription sont génériques. Ce guide classe les cinq leviers par effet mesuré : distance du micro, voix qui se chevauchent, bruit et silence, langue et vocabulaire, et variante du modèle — avec les chiffres publiés qui montrent de combien chacun déplace votre taux d’erreur.

Réponse rapide : la précision d’une transcription se joue, pour l’essentiel, avant que le moindre logiciel ne s’exécute. Les données publiées classent les leviers dans cet ordre : la distance du micro et l’acoustique de la pièce (le même modèle phare qui obtient 2–3 % de taux d’erreur de mots sur de la parole enregistrée de près tombe autour de 16 % sur des réunions à micros éloignés — une erreur multipliée par cinq), les voix qui se chevauchent (la raison principale pour laquelle les corpus de réunion occupent le bas de tous les benchmarks), le bruit et les longs silences (c’est dans le silence que les modèles inventent du texte que personne n’a prononcé), la langue et le vocabulaire (les taux d’erreur publiés par langue s’étalent sur plus d’un facteur dix), et enfin la variante du modèle — le seul levier qui soit un pur choix logiciel. Chaque affirmation ci-dessous renvoie à son chiffre mesuré.

Ce guide a été écrit par l’équipe LoroNote le 27 août 2026. Tous les chiffres de benchmark proviennent des sources primaires rassemblées dans notre page de statistiques vérifiées sur la transcription ; la méthode de mesure de la fin vient de notre guide du taux d’erreur de mots. LoroNote exécute Whisper Large V3 Turbo sur l’appareil : améliorer vos conditions d’enregistrement améliore la sortie de notre propre produit — nous n’avons aucun intérêt à vous dire que tout va déjà très bien.

Les cinq leviers, classés par effet mesuré

LevierLa preuve mesuréeCe que vous contrôlez
1. Distance du micro~2–3 % de WER micro proche contre ~16 % en réunion à micros éloignés (même modèle)L’endroit où est posé le téléphone
2. Voix qui se chevauchentLes corpus de réunion avec chevauchements ferment la marche de tous les benchmarksTours de parole, placement
3. Bruit et silenceDégradation brutale sous ~10 dB de rapport signal/bruit ; hallucinations sur le silenceEnvironnement, découpage
4. Langue et vocabulaireLes WER publiés par langue vont de 4,3 % à 55,7 % ; noms et jargon échouent en premierDictionnaire personnalisé, noms articulés
5. Variante du modèleWhisper Small a fait environ deux fois plus d’erreurs que les moteurs de classe LargeLe choix de l’app — seul levier purement logiciel

L’ordre a son importance. Celui qui part en quête d’une meilleure application actionne le levier 5, alors que l’essentiel des dégâts se joue aux leviers 1 à 3.

Microphone dynamique Shure SM57 posé sur un fond blanc

Un micro dynamique de scène — mais l’essentiel n’est pas le matériel : c’est la distance entre le micro, celui du téléphone compris, et la voix. Source :

Wikimedia Commons (E bailey)

, CC BY-SA 4.0.

Levier 1 : la distance du micro — un facteur cinq à lui seul

Le premier facteur de précision, de loin, est la distance entre le micro et la bouche. La démonstration publiée la plus propre est un même modèle mesuré selon les conditions : Whisper Large V3 obtient en moyenne environ 7,4 % de WER sur huit corpus anglais variés, à peu près 2–3 % sur de la parole lue propre enregistrée de près — et autour de 16 % sur le corpus AMI, enregistré dans des salles de réunion avec des micros éloignés. D’une condition à l’autre, le logiciel, lui, n’a pas changé.

Concrètement :

  • Déplacez le téléphone avant d’ouvrir le portefeuille. Un téléphone posé près de la personne qui parle fait mieux qu’une installation coûteuse à l’autre bout de la pièce. Pour un entretien à deux, le téléphone se place entre vous, plus près de la voix la plus faible.
  • En réunion, centrez l’appareil sur la table plutôt qu’à votre place. Chaque mètre supplémentaire vers le locuteur le plus éloigné coûte plus que ce qu’un changement d’application pourra jamais récupérer.
  • Si vous dictez seul, la partie est déjà gagnée. Un téléphone à bout de bras, c’est de la parole enregistrée de près — le haut de l’échelle. Si vos enregistrements en solo se transcrivent mal, le problème vient de l’un des leviers ci-dessous, pas de la distance.

Levier 2 : les voix qui se chevauchent

Les chevauchements sont la seconde raison pour laquelle l’audio de réunion ferme la marche des benchmarks. Quand deux personnes parlent en même temps, il n’existe pas de signal propre à transcrire — le modèle doit choisir un flux, et chaque mot de l’autre devient une erreur. C’est un problème de physique avant d’être un problème de logiciel, et c’est pourquoi il survit à chaque nouvelle génération de modèles.

Concrètement :

  • Une voix à la fois vaut mieux que n’importe quel réglage. Dans les réunions que vous animez, la discipline de laisser chacun finir sa phrase est un gain de précision à part entière.
  • Placez les voix importantes près du micro. Si un décideur marmonne depuis le coin le plus éloigné, c’est dans ce coin que la transcription déraillera.
  • Les étiquettes de locuteur souffrent, elles aussi, des chevauchements. Identifier qui a dit quoi est une étape distincte, avec ses propres modes d’échec — comment fonctionne l’identification des locuteurs montre où elle atteint ses limites. Une transcription peut contenir les bons mots et les attribuer à la mauvaise personne pendant un chevauchement.

Levier 3 : le bruit, la musique et le silence

Un bruit de fond régulier dégrade la transcription progressivement ; les tests de robustesse de l’article Whisper lui-même montrent que la reconnaissance s’effondre une fois le rapport signal/bruit descendu sous environ 10 dB — le niveau d’un café ou d’un bar bruyant, où les modèles concurrents se dégradaient d’ailleurs plus vite que Whisper. La musique est pire que le bruit pour une raison plus subtile : les modèles entraînés sur d’immenses corpus web ont vu beaucoup de musique avec paroles, et ils essaieront de la transcrire.

Le silence porte son propre piège. Une étude de 2024 sur l’API de Whisper a trouvé des phrases hallucinées dans environ 1 % des transcriptions — des phrases inventées concentrées là où l’audio devient silencieux, et de façon disproportionnée dans la parole des personnes qui font de longues pauses. (Les insertions nées du silence sont aussi ce qui permet à un taux d’erreur de mots de dépasser 100 %.)

Concrètement :

  • Choisissez la pièce plus calme plutôt que le meilleur micro. Un téléphone dans une pièce silencieuse vaut mieux qu’un bon micro dans une pièce bruyante.
  • Coupez la musique de fond quand un enregistrement compte. Elle est à la fois un bruit qui masque et un texte concurrent.
  • Coupez les longs passages silencieux avant de transcrire, ou enregistrez par segments — le silence n’est pas un remplissage neutre ; c’est là qu’apparaît le texte inventé. Ensuite, relisez avec méfiance les passages silencieux du texte transcrit.

Levier 4 : la langue, l’accent et le vocabulaire

Les chiffres publiés par langue pour le même modèle Whisper s’étalent sur plus d’un facteur dix — de 4,3 % (néerlandais) à 55,7 % (albanais) sur Common Voice 15. Les écarts liés à l’accent sont réels et documentés eux aussi : une recherche évaluée par les pairs a mesuré un taux d’erreur moyen de 35 % pour des locuteurs noirs américains contre 19 % pour des locuteurs blancs, sur cinq systèmes commerciaux testés en 2019. Aucun réglage ne fera sortir un modèle de sa distribution d’entraînement — mais deux choses restent réellement entre vos mains :

  • Les noms, le jargon et les noms de produits échouent en premier — et toujours au même endroit. Un modèle n’a jamais vu le nom de votre client ; il devinera le même mot faux à chaque fois. C’est le seul problème de précision qui ait une solution directe : le dictionnaire personnalisé de LoroNote existe pour apprendre une fois les termes récurrents, et le modèle cesse de deviner.
  • Dites les nombres, les noms et les codes en articulant. L’habitude ne coûte rien et vise exactement les mots dont les erreurs coûtent le plus — une date déformée et un mot de remplissage déformé comptent pareil dans un benchmark ; dans la vraie vie, non.
  • Si votre langue est bas dans les classements publiés, un test de deux minutes sur votre propre audio vous en dira plus que n’importe quel tableau — le graphique par langue, et pourquoi certaines langues sont notées en CER plutôt qu’en WER, sont dans le guide du WER.

Levier 5 : la variante du modèle — le seul levier purement logiciel

Une fois l’audio aussi bon que les circonstances le permettent, le levier restant est le modèle que votre application exécute. L’écart n’a rien de subtil : dans le seul benchmark qui les a fait tourner côte à côte, Whisper Small a obtenu 3,74 % sur LibriSpeech test-clean et 7,95 % sur test-other, quand les moteurs de classe Large se tenaient près de 2 % et 4,5 % — environ deux fois moins d’erreurs, à cause d’un choix de taille de modèle fait à votre place. « Powered by Whisper » sur une fiche d’application couvre des tailles dont la précision varie du simple au double, et plusieurs applications iOS exécutent discrètement les petites tailles.

Concrètement : avant de changer d’application pour des raisons de précision, vérifiez quelle variante chaque application charge réellement. LoroNote exécute Whisper Large V3 Turbo — un modèle de la famille Large — sur l’appareil ; sur un iPhone 15 Pro, la transcription tourne à environ 19 fois le temps réel (notre propre mesure), si bien que la précision d’un grand modèle ne vous impose pas d’attendre le temps d’un café.

Ce qui n’aide pas beaucoup

Trois réflexes courants que les mesures ne confirment pas :

  • Enregistrer à une fréquence d’échantillonnage plus élevée. Whisper rééchantillonne tout l’audio à 16 000 Hz avant d’écouter — l’article le dit explicitement. Un fichier studio à 96 kHz et un simple mémo vocal arrivent au modèle sous la même forme ; investissez plutôt l’effort dans la distance et le calme.
  • Un téléphone plus récent. Le micro d’un iPhone récent n’est pas le goulot d’étranglement ; sa position, oui. (Un téléphone plus récent peut transcrire plus vite, ce qui est une autre propriété.)
  • Les filtres « d’amélioration » avant transcription. Une réduction de bruit agressive peut brouiller la structure harmonique que lit le modèle. Si vous en utilisez un, vérifiez-le par un comptage avant/après sur le même extrait plutôt que de vous fier à un audio qui sonne plus propre — plus propre pour votre oreille n’est pas plus propre pour un lecteur de spectrogrammes.

Mesurez l’effet, pas l’impression

Chaque levier ci-dessus se teste en dix minutes : enregistrez deux minutes dans votre configuration actuelle, transcrivez, comptez les erreurs sur un passage de 200 mots avec des règles fixées d’avance ; changez une seule chose — rapprochez le téléphone, coupez la musique — et refaites le même passage. La méthode de comptage complète, y compris la décision préalable de ce qui compte comme une erreur, est dans notre guide du WER. Comme LoroNote transcrit sur l’appareil et que les deux premières minutes de chaque enregistrement sont gratuites, l’expérience avant/après ne coûte rien et fonctionne en mode Avion.

Questions fréquentes

Pourquoi ma transcription est-elle si inexacte ?

Vérifiez les leviers dans l’ordre : la distance entre le micro et les locuteurs, si des personnes ont parlé en même temps, le niveau sonore de la pièce et la part de silence dans l’enregistrement, si les mots qui échouent sont des noms propres et du jargon, et enfin quel modèle votre application exécute. Dans les benchmarks publiés, l’éloignement du micro fait passer, à lui seul, le même modèle d’environ 2–3 % à autour de 16 % de taux d’erreur — plus que ce qu’un changement d’application peut récupérer.

Un micro externe améliore-t-il la précision de la transcription ?

C’est la proximité qui fait la précision ; un micro externe est un moyen de l’obtenir. Un micro-cravate sur le locuteur, c’est de la parole enregistrée de près même dans une grande salle. Mais un téléphone bien placé obtient l’essentiel du même effet gratuitement — la position d’abord, le matériel ensuite.

La musique de fond affecte-t-elle la transcription ?

Oui, doublement : elle masque la voix comme n’importe quel bruit, et comme les modèles ont vu d’immenses quantités d’audio avec paroles, ils peuvent transcrire la chanson au lieu du locuteur. La reconnaissance se dégrade aussi brutalement dès que le rapport signal/bruit tombe autour de 10 dB, le niveau d’un café bruyant. Coupez la musique pour les enregistrements qui comptent.

Puis-je corriger les erreurs d’accent avec un réglage ?

Pas avec un réglage — la gestion des accents est inscrite dans les données d’entraînement du modèle, et la recherche a documenté des écarts démographiques réels. Ce qui reste entre vos mains : choisir une application qui exécute un modèle de classe Large (les grands modèles absorbent mieux les variations de prononciation), ajouter les noms et termes récurrents au dictionnaire personnalisé, et mesurer sur vos propres deux minutes plutôt que de vous fier à des moyennes calculées sur les voix des autres.

Les enregistrements longs se transcrivent-ils moins bien ?

La durée en soi n’est pas un facteur de précision documenté — les conditions, oui. Un cours de trois heures enregistré de près et au calme se transcrit comme ses dix premières minutes. Ce qui grandit avec la durée, c’est le coût de la relecture des erreurs, et c’est pourquoi les corrections ci-dessus comptent d’autant plus que vos enregistrements sont longs.

Le mot de la fin sur la précision de la transcription

Les conseils de précision pointent d’habitude vers le logiciel, parce que le logiciel est facile à changer. Les mesures pointent dans l’autre sens : le facteur cinq se joue dans la distance du micro et l’acoustique de la pièce, les échecs les plus tenaces viennent des chevauchements et du silence, et le seul levier logiciel honnête est la variante de modèle que charge votre application. Rapprochez le téléphone, calmez la pièce, parlez chacun votre tour, ajoutez vos noms propres au dictionnaire, vérifiez le modèle — dans cet ordre — et validez chaque changement par un comptage avant/après sur votre propre enregistrement, parce que le seul chiffre de précision qui compte est le vôtre.

Sources

Chiffres revérifiés dans les sources liées les 26 et 27 août 2026.

Votre voix devient du texte — hors ligne

LoroNote transcrit réunions, cours et interviews directement sur votre iPhone — privé, précis et illimité.

Télécharger sur l’App Store