
Sommaire
- Ce qu’est réellement SpeechAnalyzer
- Le benchmark que tout le monde a cité
- Trois choses que le benchmark n’a pas mesurées
- À propos du « trois fois plus rapide »
- Quand chacun est le meilleur choix
- Ce que cela change pour choisir une application iPhone
- Testez vous-même en cinq minutes
- Questions fréquentes
- Sources
Réponse rapide : dans le benchmark que tout le monde a partagé, le nouveau SpeechAnalyzer sur appareil d’Apple a bel et bien battu Whisper — 2,12 % de taux d’erreur sur les mots contre 3,74 % sur LibriSpeech test-clean. Sauf que ce test faisait tourner Whisper Small, sur des livres audio en anglais, sur un Mac. Il n’a jamais testé Whisper Large V3 ni Large V3 Turbo, c’est-à-dire les modèles qu’une application iPhone charge réellement sur l’appareil, et il n’a touché ni à une réunion, ni à un accent, ni à aucune des quelque 99 autres langues de Whisper. Le moteur d’Apple est rapide, précis et gratuit — à l’intérieur des 22 langues qu’il prend en charge. Whisper en couvre environ cinq fois plus.
Tous les chiffres ci-dessous proviennent de l’article de l’auteur du benchmark, des publications et fiches de modèle d’OpenAI, de l’Open ASR Leaderboard ou de la documentation développeur d’Apple — tout est lié à la fin. Ce texte a été écrit par l’équipe LoroNote le 23 août 2026. LoroNote exécute Whisper Large V3 Turbo sur l’appareil : nous avons donc un intérêt dans cette comparaison. C’est précisément pour cela que chaque chiffre ici est la mesure de quelqu’un d’autre, pas la nôtre.
Ce qu’est réellement SpeechAnalyzer
SpeechAnalyzer est le framework vocal qu’Apple a présenté à la WWDC 2025 et livré avec iOS 26. Il remplace SFSpeechRecognizer, l’API vieillissante qui a porté l’essentiel de la dictée tierce sur iOS pendant une décennie.
Deux modules publics comptent :
SpeechTranscriberconvertit la parole en texte.SpeechDetectorrepère où il y a de la parole dans un flux audio.
Tout s’exécute sur l’appareil. Les ressources linguistiques se téléchargent via le catalogue système plutôt que d’être embarquées par chaque application, ce qui explique qu’une application utilisant cette API n’augmente presque pas sa taille de téléchargement. Pour les langues que SpeechTranscriber ne couvre pas, Apple fournit DictationTranscriber en solution de repli.
Il y a une condition ferme que la plupart des comparatifs sautent : SpeechAnalyzer exige iOS 26 ou une version ultérieure et n’est pas rétrocompatible. Sur un iPhone resté en iOS 18, la fonction n’existe tout simplement pas.
Le benchmark que tout le monde a cité
Les chiffres qui ont circulé dans la presse tech en juillet 2026 viennent d’une seule évaluation menée par un développeur. Voici ce qui a réellement été mesuré :
| Paramètre | Valeur |
|---|---|
| Corpus | LibriSpeech — 5 559 énoncés (2 620 test-clean, 2 939 test-other) |
| Audio | Parole lue de livre audio, un seul locuteur, enregistrement propre |
| Langue | anglais uniquement |
| Matériel | M2 Pro, 32 Go, macOS 26.5.1, intégralement sur l’appareil |
| Variantes Whisper testées | Tiny, Base, Small |
Et les résultats :
| Moteur | WER test-clean | WER test-other |
|---|---|---|
| Apple SpeechAnalyzer | 2,12 % | 4,56 % |
| Whisper Small (~460 Mo) | 3,74 % | 7,95 % |
| Whisper Base (~140 Mo) | 5,42 % | 12,51 % |
| Whisper Tiny (~40 Mo) | 7,88 % | 17,04 % |
| SFSpeechRecognizer (ancien) | 9,02 % | 16,25 % |
Deux choses méritent d’être dites franchement à propos de ce tableau. L’écart d’Apple face à sa propre ancienne API est énorme — environ 75 % d’erreurs en moins, et c’est la vraie nouvelle pour quiconque avait bâti sur SFSpeechRecognizer. Et Apple a effectivement battu tous les modèles Whisper testés.
Le problème, c’est lesquels ont été testés.
Trois choses que le benchmark n’a pas mesurées
1. Les modèles Whisper que les applications sur appareil font réellement tourner
Whisper Small pèse 460 Mo. Ce n’est pas ce qu’une application de transcription sérieuse charge sur un iPhone récent. LoroNote exécute Large V3 Turbo : 809 millions de paramètres, avec un décodeur ramené de 32 couches à 4 pour la vitesse.
Le benchmark s’est arrêté avant Medium, Large et Turbo. Pour situer, des évaluations publiées placent Whisper Large V3 sur LibriSpeech autour de 2,0–2,5 % de WER sur test-clean et 3,9–4,3 % sur test-other — le même voisinage que les 2,12 % et 4,56 % d’Apple, voire légèrement mieux.
Prenez cette comparaison avec précaution. Ces chiffres Whisper proviennent d’évaluations distinctes, avec leur propre normalisation de texte, et non d’un duel sur la même machine face au moteur d’Apple. Le seul choix de normalisation peut déplacer le WER LibriSpeech de plus d’un point — notre guide du WER explique comment. La conclusion honnête n’est pas « Whisper Large gagne ». C’est que aucun test publié n’a comparé le moteur d’Apple aux modèles Whisper dont il est réellement question — et que l’écart suggéré par les titres est un artefact de la taille de modèle retenue.
2. Tout ce qui est plus difficile qu’un livre audio de studio
LibriSpeech, c’est de la parole lue : une personne, un livre, un bon micro, aucun chevauchement. C’est le barreau le plus bas de l’échelle, et c’est précisément là que chaque moteur affiche son meilleur score.
Les enregistrements réels se situent plus haut. Sur l’échelle de précision que nous avons documentée pour Whisper, ce même Large V3 qui obtient 2–3 % sur de la parole lue propre tourne en moyenne autour de 7,4 % sur un mélange de benchmarks anglais réels et autour de 16 % sur l’audio de réunion AMI, avec micros éloignés et voix qui se chevauchent.
Personne n’a publié ces barreaux pour SpeechAnalyzer. Tant que ce sera le cas, un score de 2,12 % sur livre audio dit très peu de chose d’une réunion à quatre enregistrée depuis le milieu de la table. L’auteur du benchmark a été clair là-dessus : son article décrit le corpus comme de la « parole lue de livre audio, pas des réunions ».
3. Quatre-vingt-dix-neuf autres langues
C’est le plus grand écart, et l’auteur l’a signalé directement : ces chiffres « ne disent rien des plus de 100 langues que Whisper prend en charge ».
En août 2026, SpeechTranscriber.supportedLocales renvoie 42 variantes régionales couvrant 22 langues :
allemand, anglais (neuf variantes régionales), arabe, cantonais, chinois (simplifié, traditionnel, Hong Kong), coréen, danois, espagnol, finnois, français, hébreu, italien, japonais, malais, néerlandais, norvégien (bokmål), portugais, russe, suédois, thaï, turc et vietnamien.
Whisper Large V3 en couvre une centaine. Les absents de la liste d’Apple ne sont pas des cas marginaux : pas de hindi, pas de polonais, pas de tchèque, pas de grec, pas d’ukrainien, pas d’indonésien. Le portugais n’existe qu’en pt_BR ; il n’y a pas de variante portugaise d’Europe.
Pour un lecteur francophone, le point clé est ailleurs. fr_FR, fr_BE, fr_CA et fr_CH figurent tous sur la liste d’Apple : la prise en charge n’est donc pas le sujet. Le sujet, c’est qu’aucun chiffre de précision en français n’a été publié pour l’un ou l’autre moteur. Le benchmark très cité n’a mesuré que l’anglais, et Apple ne publie pas de WER par langue. Affirmer aujourd’hui qu’Apple transcrit mieux le français que Whisper, ou l’inverse, revient donc à avancer sans base. Deux minutes de votre propre enregistrement restent la source la plus solide.
Apple a annoncé d’autres langues à venir, cette liste finira donc périmée. Mais « pris en charge » et « aussi précis » restent deux affirmations différentes pour les deux moteurs. D’où l’intérêt de confronter la liste complète des langues à votre propre audio plutôt que de vous fier à un décompte.
À propos du « trois fois plus rapide »
L’argument de vitesse a voyagé aussi loin que celui de la précision, avec la même note de bas de page : la mesure a été faite face à Whisper Small.
Ce que le benchmark rapporte, c’est une plage de débit d’environ 12 à 40 fois le temps réel sur un M2 Pro — une heure d’audio en 1,5 à 5 minutes. L’auteur a délibérément retenu les temps précis par modèle en attendant des mesures plus propres sur une machine au repos.
Cette plage est réelle et le moteur d’Apple est rapide. Elle provient toutefois d’une puce M de bureau avec 32 Go de RAM, pas d’un téléphone. Sur iPhone, la contrainte déterminante pour tout modèle de transcription est la mémoire, pas la puissance de calcul brute. C’est aussi pourquoi plusieurs « applications Whisper » connues chargent discrètement small ou medium sur le téléphone alors que leurs versions Mac exécutent large. Nous avons recensé quelle variante chaque application iOS charge réellement.
Quand chacun est le meilleur choix
Aucun des deux ne gagne dans l’absolu. Ils sont conçus pour des usages différents.
Choisissez Apple SpeechAnalyzer si :
- votre langue fait partie des 22 prises en charge, en particulier s’il s’agit de l’anglais ;
- votre appareil est en iOS 26 ou plus récent ;
- vous voulez une transcription en direct, avec des résultats partiels qui se mettent à jour pendant que la personne parle — c’est ce pour quoi l’API est pensée ;
- vous ne voulez ni téléchargement de modèle ni coût.
Choisissez la famille Whisper Large V3 si :
- votre langue est hors de la liste d’Apple, ou vos enregistrements mélangent plusieurs langues dans un même fichier ;
- vous avez besoin du même comportement sur des appareils plus anciens — les applications basées sur Whisper tournent bien en deçà d’iOS 26 ;
- vous transcrivez des fichiers existants plutôt que de la parole en direct, là où la précision compte plus que la latence ;
- vous voulez un transcript identique quelle que soit la version du système.
Il n’y a de repas gratuit dans aucun sens. Le moteur d’Apple s’intègre plus vite, ne coûte rien et excelle dans son périmètre. Le périmètre de Whisper est environ cinq fois plus large, et les variantes Large paient cette largeur en taille de modèle et en temps de traitement.
Ce que cela change pour choisir une application iPhone
Deux conséquences concrètes.
D’abord, « transcription IA » sur l’App Store désigne désormais au moins trois choses différentes : une application qui appelle le SpeechAnalyzer sur appareil d’Apple, une application qui exécute son propre modèle Whisper localement, ou une application qui envoie votre audio sur un serveur. Confidentialité, fonctionnement hors ligne et couverture linguistique n’ont rien à voir, et les fiches le précisent rarement. Notre comparatif des applications de reconnaissance vocale iOS les classe selon l’endroit où l’audio est traité.
Ensuite, « sur l’appareil » ne dit plus rien de la précision. Les deux voies sont locales. La question est passée de où va mon audio à quel modèle, à quelle taille, dans quelle langue.
Testez vous-même en cinq minutes
Un benchmark est une moyenne sur des corpus que vous n’enregistrerez jamais. Votre propre audio est le seul test qui réponde à votre question :
- Enregistrez deux minutes dans la pièce où vous enregistrez d’habitude — votre micro, votre accent, quelques noms propres, chiffres et termes techniques.
- Transcrivez avec la transcription intégrée de votre iPhone (Dictaphone sur un appareil compatible, ou une application utilisant le moteur d’Apple).
- Transcrivez le même fichier avec une application basée sur Whisper.
- Comptez les erreurs sur 200 mots : chaque mot remplacé, manquant ou inventé. Erreurs ÷ 200 = votre WER. (La méthode complète, y compris comment décider de ce qui compte comme une erreur, se trouve dans notre guide du WER.)
Si les deux ressortent propres, prenez le plus pratique. L’écart apparaît généralement sur les noms propres, la parole qui se chevauche et toute langue hors du groupe le mieux doté — exactement là où le benchmark a cessé de regarder.
Questions fréquentes
Apple SpeechAnalyzer est-il plus précis que Whisper ?
Face à Whisper Small sur des livres audio en anglais propres, oui — 2,12 % contre 3,74 % de WER. Face à Whisper Large V3 ou Large V3 Turbo, personne n’a publié de test direct. Des évaluations distinctes placent Large V3 au même niveau ou légèrement devant sur le même corpus, mais des normalisations différentes en font une comparaison approximative plutôt qu’un verdict.
Lequel est le plus précis en français ?
Aucun chiffre n’a été publié. Le benchmark très cité n’a mesuré que l’anglais, et Apple ne communique pas de WER par langue. fr_FR, fr_BE, fr_CA et fr_CH figurent sur la liste d’Apple, la prise en charge n’est donc pas en cause. Pour la précision, le test sur deux minutes de votre propre enregistrement reste la seule méthode fiable aujourd’hui.
SpeechAnalyzer fonctionne-t-il hors ligne ?
Oui. Tout s’exécute sur l’appareil, les ressources linguistiques étant téléchargées une fois via le catalogue système. Sur ce point, il rejoint une application Whisper locale : ni l’un ni l’autre n’envoie votre audio sur un serveur.
Faut-il iOS 26 ?
Oui. SpeechAnalyzer exige iOS 26 ou une version ultérieure et n’est pas rétrocompatible. Les applications basées sur Whisper fonctionnent sur des versions nettement plus anciennes, ce qui est une raison pratique de garder les deux moteurs en tête.
L’un des deux identifie-t-il qui parle ?
L’identification des locuteurs est une étape distincte de la transcription, et aucun des deux moteurs ne l’effectue au sein de la reconnaissance vocale. Les applications l’ajoutent par-dessus — comment fonctionne la séparation des locuteurs explique ce que cela suppose et où cela achoppe.
Pourquoi LoroNote utilise-t-il Whisper plutôt que le moteur d’Apple ?
Pour la couverture linguistique et la couverture matérielle. LoroNote transcrit une centaine de langues, y compris des enregistrements multilingues, sur des appareils bien antérieurs à iOS 26. Le moteur d’Apple est excellent dans ses 22 langues, mais il ne remplace pas cette largeur. Nous expliquons le choix précis du modèle dans notre guide de Whisper Large V3 Turbo.
Sources
- Apple, Bring advanced speech-to-text to your app with SpeechAnalyzer — session WWDC25 présentant le framework
- Apple, documentation SpeechTranscriber
- Lyonesse, Apple’s New Speech API vs Whisper: The First Real Benchmark — l’évaluation LibriSpeech, sa méthodologie et ses limites annoncées
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — l’article Whisper
- OpenAI, fiche du modèle whisper-large-v3 et fiche du modèle whisper-large-v3-turbo
- Open ASR Leaderboard — chiffres des benchmarks mixtes et de l’audio de réunion AMI
Chiffres du benchmark vérifiés le 23 août 2026. La liste des langues prises en charge par Apple évolue avec les mises à jour du système ; vérifiez SpeechTranscriber.supportedLocales sur une version récente avant de vous y fier.
Votre voix devient du texte — hors ligne
LoroNote transcrit réunions, cours et interviews directement sur votre iPhone — privé, précis et illimité.
Télécharger sur l’App Store