Meilleures apps Whisper pour iPhone et iOS en 2026 : quel modèle chacune exécute
Mis à jour: Équipe LoroNote 22 min

Sommaire
- Qu’est-ce qu’une app Whisper ?
- « Whisper » ne dit pas où va votre audio
- Quel modèle Whisper chaque app exécute-t-elle ?
- 1. LoroNote — la plus grande variante de Whisper exécutée sur le téléphone
- Les performances réelles de Whisper Large V3 Turbo
- 2. Whisper Notes — trois modèles, interchangeables, un seul paiement
- 3. Aiko — la plus transparente, et la plus limitée
- 4. Whisper Memos — Whisper, mais dans le cloud
- Propulsées par Whisper aussi, mais pour un autre travail
- Comment choisir
- Questions fréquentes
- Le mot de la fin sur le choix d’une app Whisper pour iOS
- Sources
Réponse rapide : les meilleures apps Whisper pour iOS en 2026 sont LoroNote (Whisper Large V3 Turbo, sur l’appareil), Whisper Notes (Whisper plus Parakeet et SenseVoice, sur l’appareil), Aiko (Whisper medium ou small sur iPhone, sur l’appareil) et Whisper Memos (Whisper dans le cloud, livré dans votre boîte mail). L’étiquette « app Whisper » ne désigne que la famille de modèles — elle ne dit rien de la taille de Whisper exécutée, ni du fait que votre audio reste ou non sur l’iPhone. Ces deux faits diffèrent entre les quatre apps, et ils comptent plus que l’étiquette.
- Meilleur modèle Whisper sur iPhone : LoroNote — Large V3 Turbo, la plus grande variante de Whisper que l’une de ces apps exécute localement sur iOS
- Meilleure pour changer de modèle : Whisper Notes — Whisper, Parakeet et SenseVoice dans une seule app, 6,99 $ une fois
- Meilleur achat unique multi-plateformes Apple : Aiko — 24,00 $ une fois, aussi sur Mac et Apple Vision
- Meilleure si vous voulez recevoir vos transcriptions par e-mail : Whisper Memos — traitement cloud, résumés IA automatiques
Ce comparatif a été compilé par l’équipe LoroNote le 13 août 2026. LoroNote est notre propre app. Chaque affirmation sur une autre app provient de sa propre fiche App Store américaine, lue à cette date, et tout ce qu’une fiche ne précise pas est marqué « non précisé » plutôt que deviné.
Qu’est-ce qu’une app Whisper ?
Whisper est une famille de modèles de reconnaissance vocale open source publiée par OpenAI. Une « app Whisper » est n’importe quelle app qui utilise l’un de ces modèles pour transformer l’audio en texte.
Cette étiquette unique masque deux décisions qui changent complètement le produit :
- Quelle variante de Whisper. Whisper existe en plusieurs tailles — tiny, base, small, medium et large, plus les récentes
large-v3etlarge-v3-turbo. La précision grimpe avec la taille ; l’usage mémoire, le temps de traitement et la consommation de batterie aussi. Un téléphone qui exécutesmallet un téléphone qui exécutelarge-v3-turbone font pas le même travail. - Où elle s’exécute. Whisper est open source, alors une app peut l’exécuter sur votre iPhone — ou appeler un serveur qui l’exécute. Les deux sont légitimement « propulsées par Whisper ». Une seule garde votre audio sur votre appareil.
Aucun de ces deux faits n’apparaît dans la catégorie App Store, et la plupart des fiches ne les mentionnent pas spontanément. Les rassembler est précisément l’objet de ce comparatif.
« Whisper » ne dit pas où va votre audio
C’est le contresens le plus courant, et il mérite d’être énoncé sans détour : une app construite sur Whisper n’est pas privée pour autant.
Whisper Memos et VoicePen affirment toutes deux être propulsées par OpenAI Whisper. Toutes deux envoient votre enregistrement à un serveur pour la transcription. C’est un choix d’ingénierie raisonnable — les serveurs sont plus rapides, gèrent n’importe quel appareil et rendent possibles des fonctions comme les résumés par e-mail — mais c’est l’opposé de ce que beaucoup de gens supposent en voyant le nom Whisper accolé à un modèle open source et auto-hébergeable.
Si garder l’audio sur l’appareil est votre véritable exigence, l’étiquette à chercher n’est pas « Whisper ». C’est une déclaration explicite indiquant que la transcription s’exécute localement, idéalement avec une promesse que vous pouvez tester vous-même. Notre guide de transcription hors ligne explique le fonctionnement de ce flux de données, et notre sélection d’apps hors ligne classe les apps précisément selon ce critère. Cet article répond à une autre question : non pas « fonctionne-t-elle sans internet », mais « quel Whisper tourne réellement, et quelle est sa qualité ».
Quel modèle Whisper chaque app exécute-t-elle ?
Tout ce tableau provient de la fiche App Store américaine de chaque app, lue le 13 août 2026.
| App | Variante de Whisper (selon la fiche) | Lieu d’exécution | Autres modèles proposés | Prix (US) | Note US |
|---|---|---|---|---|---|
| LoroNote | Large V3 Turbo | Sur l’appareil | — | Gratuit + achats intégrés | 4,8 (43) |
| Whisper Notes | Non précisée | Sur l’appareil | Parakeet, SenseVoice | 6,99 $ une fois | 4,6 (563) |
| Aiko | medium ou small sur iOS, large-v3 sur macOS | Sur l’appareil | — | 24,00 $ une fois | 4,7 (325) |
| Whisper Memos | Non précisée | Cloud | ElevenLabs Scribe | Gratuit + achats intégrés | 4,6 (388) |
Deux points ressortent. Aiko est la seule app qui publie exactement quelle variante elle charge, et elle reconnaît franchement que l’iPhone reçoit un modèle plus petit que le Mac — elle « utilise le modèle Whisper medium ou small sur iOS selon la mémoire disponible et le modèle large v3 sur macOS ». Et LoroNote est la seule à exécuter une variante de la série Large sur le téléphone lui-même.
La note mondiale de LoroNote, toutes vitrines confondues, est de 4,7 pour 279 évaluations ; le tableau utilise les chiffres américains pour que chaque ligne repose sur la même base.
1. LoroNote — la plus grande variante de Whisper exécutée sur le téléphone
LoroNote exécute Whisper Large V3 Turbo directement sur iPhone et iPad. Turbo est le dérivé de large-v3 optimisé pour la vitesse par OpenAI, et c’est la raison pour laquelle un modèle de la série Large est tout simplement praticable sur un téléphone. La section suivante détaille exactement ce que cela vous apporte et ce que cela coûte ; nous avons aussi expliqué cette décision dans pourquoi LoroNote utilise Whisper Large V3 Turbo.
L’audio et le texte sont traités localement : la transcription fonctionne en mode Avion et un enregistrement confidentiel n’atteint jamais un serveur de transcription. L’identification des intervenants s’exécute elle aussi sur l’appareil — vous pouvez renommer les intervenants et les étiquettes survivent au partage de la transcription. Voir comment fonctionne la diarisation.
Autour du modèle s’articule le flux de travail : surlignage synchronisé et lecture en touchant une ligne, dossiers, calendrier, recherche, rechercher-remplacer groupé, et un dictionnaire personnalisé pour les noms et termes techniques. La capture couvre l’enregistrement dans l’app, l’enregistrement depuis l’Apple Watch et l’import de MP3, WAV, M4A, MP4 et MOV. Les exports sont le TXT et le SRT. Sur les appareils compatibles, Apple Intelligence peut résumer une transcription ou en extraire des actions sans rien envoyer nulle part.
Idéale pour : obtenir le résultat Whisper local le plus précis disponible sur un iPhone, dans l’une de plus de 100 langues.
À garder en tête : un modèle de la série Large exige du matériel récent — iPhone 13 ou ultérieur, iPhone SE (3e génération) ou un iPad récent compatible, sous iOS 18.6 ou ultérieur. Il n’existe pas de version Mac, Windows, web ou Android. Un modèle plus grand signifie aussi un traitement plus long que ne le prendrait un modèle small sur le même fichier.
Les performances réelles de Whisper Large V3 Turbo
Turbo est la variante qui décide si un Whisper de la série Large est utilisable sur un téléphone, alors elle mérite un examen détaillé. Chaque chiffre ci-dessous provient du tableau de modèles d’OpenAI et des notes de publication de large-v3-turbo.
Ce qu’OpenAI a changé pour le rendre rapide
Turbo n’est pas un Whisper plus petit entraîné de zéro. C’est large-v3 avec un décodeur réduit : 4 couches de décodeur au lieu des 32 de la série large — la même profondeur de décodeur que tiny. L’encodeur, la partie qui construit une représentation acoustique de l’audio, est laissé intact.
Cette asymétrie est toute l’astuce. L’encodeur de Whisper s’exécute une fois par fenêtre de 30 secondes, mais le décodeur s’exécute de façon autorégressive, une fois par token produit. Sur un long enregistrement, le décodeur domine le temps total ; diviser sa profondeur par huit supprime donc l’essentiel du coût, tandis que l’encodeur conserve la qualité acoustique multilingue qui fait la valeur de large-v3 au départ.
OpenAI a ensuite affiné le résultat « pendant deux époques supplémentaires sur la même quantité de données de transcription multilingues que celles utilisées pour entraîner large-v3 » — en excluant délibérément les données de traduction.
Chiffres publiés de vitesse et de mémoire
| Modèle | Paramètres | VRAM requise | Vitesse relative |
|---|---|---|---|
large (v3) | 1 550 M | ~10 Go | 1× |
turbo | 809 M | ~6 Go | ~8× |
medium | 769 M | ~5 Go | ~2× |
small | 244 M | ~2 Go | ~4× |
tiny | 39 M | ~1 Go | ~10× |
Deux chiffres méritent d’être soulignés. Turbo est environ 8× plus rapide que large tout en portant à peine plus de la moitié de ses paramètres (809 M contre 1 550 M). Et il se situe à un nombre de paramètres comparable à medium (769 M) — la variante qu’Aiko charge sur iPhone — tout en conservant l’encodeur de large-v3. C’est le nœud de la comparaison de cet article : Turbo a à peu près le poids d’un medium mais la modélisation acoustique d’un large.
Les notes de publication vont plus loin sur la vitesse : combinée aux correctifs d’optimisation qui l’accompagnent, « la vitesse de reconnaissance vocale de turbo est plus rapide que ce qu’était celle de tiny » — un modèle 20× plus petit.
Précision : proche de large-v2, avec deux exceptions connues
L’évaluation d’OpenAI elle-même est que, toutes langues confondues, Turbo « obtient des résultats similaires à large-v2 ». Il n’est pas présenté comme l’égal de large-v3, et il ne faut pas le décrire ainsi.
Les exceptions documentées comptent si ce sont vos langues : Turbo « montre une dégradation plus marquée sur certaines langues comme le thaï et le cantonais ». Les résultats sont aussi meilleurs sur des jeux de données de lecture propre comme FLEURS que sur de l’audio participatif plus bruité comme Common Voice — un rappel que les chiffres de WER publiés flattent tous les modèles par rapport à un vrai enregistrement de réunion.
Ce que Turbo ne fait pas
- La traduction. Les données de traduction ayant été exclues de l’affinage, OpenAI ne s’attend explicitement pas à ce que Turbo excelle en traduction vocale. Il transcrit la langue qui a été parlée. Si vous avez besoin de traduction parole-vers-anglais,
large-v3est le bon modèle et Turbo le mauvais. - Une variante anglais uniquement. Contrairement à
tinyjusqu’àmedium, il n’existe pas de version.ende Turbo. Il est exclusivement multilingue. - Battre
large-v3en précision. Il échange un cran de qualité contre environ 8× la vitesse. C’est le marché.
Ce que ces chiffres signifient sur un iPhone
Une réserve que la plupart des articles omettent : les chiffres d’OpenAI de ~8× et ~6 Go sont des chiffres de référence pour l’inférence sur GPU, pas des mesures sur iPhone. Un téléphone n’a pas de réserve de VRAM dédiée, et les apps distribuées convertissent et quantifient ces modèles pour les exécuter via Core ML et le Neural Engine, ce qui change à la fois l’empreinte mémoire et le débit. Considérez le tableau comme la relation entre variantes, pas comme la fiche technique d’une app particulière.
Ce qui se transpose bien à un téléphone, c’est la forme du compromis :
- Les longs enregistrements en profitent le plus. L’élagage du décodeur économise du temps par token généré, si bien qu’un cours de 60 minutes gagne bien plus qu’un mémo de 30 secondes.
- Sur mobile, la vraie contrainte est la mémoire, pas les FLOPs. C’est exactement pourquoi la fiche d’Aiko indique choisir medium ou small sur iOS « selon la mémoire disponible », et pourquoi les exigences matérielles sont plus strictes pour les apps exécutant une variante de la série Large. LoroNote exige un iPhone 13 ou ultérieur, un iPhone SE (3e génération) ou un iPad récent compatible.
- Les clips courts sont le pire cas, pas les longs. La surcharge par fichier — chargement du modèle et découpage en fenêtres — est fixe : elle domine un mémo de dix secondes et disparaît dans un cours d’une heure. Le débit grimpe avec la longueur du fichier jusqu’à ce que les limites thermiques s’en mêlent.
- Les écarts de précision apparaissent là où l’audio est difficile, pas sur une dictée propre — accents, voix qui se chevauchent, bruit de fond et vocabulaire technique. Sur un enregistrement calme au micro rapproché en anglais, un modèle plus petit produit souvent un texte impossible à distinguer.
Combien de temps Turbo prend réellement sur un iPhone
La métrique utile est le facteur de vitesse : les secondes d’audio transcrites par seconde de traitement. Un facteur de vitesse de 60 signifie qu’une minute d’audio est transcrite en une seconde. C’est le chiffre qui répond vraiment à « combien de temps vais-je attendre », ce que les nombres bruts de paramètres ne font jamais.
Ce que LoroNote mesure sur un iPhone 15 Pro
LoroNote affiche à l’écran son Speed Factor en cours pendant la transcription : les chiffres suivants sont donc lus directement dans l’app et non déduits. Transcription d’un enregistrement de 10 minutes 31 secondes avec Whisper Large V3 Turbo sur un iPhone 15 Pro :
| Progression | Speed Factor affiché | Temps restant |
|---|---|---|
| 23 % | 17,0× | 28 s |
| 36 % | 19,7× | 20 s |
| 45 % | 19,9× | 17 s |
| 64 % | 18,8× | 12 s |
Cela se stabilise autour de 19× — environ 33 secondes de traitement pour un enregistrement de 10,5 minutes. Ce sont les mesures internes de LoroNote sur notre propre appareil, pas un benchmark indépendant ; pondérez-les comme n’importe quel chiffre de première main.
À ce rythme :
| Durée de l’enregistrement | Temps de traitement à ~19× |
|---|---|
| 1 minute | ~3 secondes |
| 5 minutes | ~16 secondes |
| 15 minutes | ~47 secondes |
| 30 minutes | ~1 min 35 s |
| 60 minutes | ~3 min 10 s |
| 2 heures | ~6 min 20 s |
Le résumé pratique : Turbo donne à un iPhone l’encodeur de large-v3 pour à peu près le poids de medium et environ 8× la vitesse de décodage du large complet, au prix d’un petit cran de précision par rapport à large-v3, de l’absence de traduction et d’une faiblesse connue en thaï et en cantonais. Sur un iPhone 15 Pro, cela signifie qu’un enregistrement d’une heure devient du texte en environ trois minutes.
2. Whisper Notes — trois modèles, interchangeables, un seul paiement
Whisper Notes est la seule app ici qui vous laisse changer de moteur : Whisper, Parakeet de NVIDIA et SenseVoice, tous exécutés sur l’appareil. Sa fiche explique quand chacun l’emporte — SenseVoice est « bien plus rapide que Whisper et le plus fort pour le chinois, le japonais et le coréen », tandis que Parakeet est l’option vitesse.
C’est aussi la seule fiche qui publie de vrais chiffres de temps : transcrire cinq minutes d’audio sur un iPhone 15 prend « ~18 secondes avec Parakeet, ~1 minute avec Whisper ». Ces chiffres viennent du développeur lui-même, mais ils sont précis et vérifiables, ce qui est plus que ce qu’offrent la plupart des apps. Pour le contexte de cette rivalité de modèles, nous les avons comparés dans Parakeet V3 vs Whisper Large V3.
Tout s’exécute localement — la fiche vous invite à « activer le mode avion avant d’enregistrer et à le laisser activé ». Vous obtenez des étiquettes d’intervenants avec renommage, aucune limite de durée d’enregistrement, plus de 100 langues et l’export en SRT, VTT ou TXT avec horodatages et étiquettes d’intervenants. Elle fonctionne sur Mac comme sur iPhone et iPad, et coûte 6,99 $ une fois, sans abonnement ni achat intégré.
Idéale pour : le travail multilingue où vous voulez choisir le moteur à chaque enregistrement, et pour quiconque préfère un paiement unique.
À garder en tête : la fiche ne précise pas quelle taille de Whisper elle charge, et elle indique que les modèles sont « optimisés pour l’anglais ».
3. Aiko — la plus transparente, et la plus limitée
Aiko est un achat unique de 24,00 $ construit sur Whisper via whisper.cpp, le portage C/C++ de Georgi Gerganov, que sa fiche crédite directement. Rien ne quitte l’appareil, l’audio est pris en charge en 100 langues, et l’app exporte des sous-titres.
C’est la fiche la plus honnête de ce comparatif, dans les deux sens. Elle publie sa sélection exacte de modèles — medium ou small sur iOS selon la mémoire disponible, large-v3 sur macOS — et elle affirme sans détour qu’elle « privilégie la précision à la vitesse », ne fait pas de transcription en direct pendant l’enregistrement, n’a pas actuellement de détection des intervenants et ne prévoit pas d’édition de texte dans l’app. Le flux de travail voulu consiste à exporter et à modifier ailleurs.
C’est aussi la seule app ici qui fonctionne sur Mac et Apple Vision en plus de l’iPhone et de l’iPad. Nous l’avons examinée de plus près dans LoroNote vs Aiko.
Idéale pour : les personnes qui veulent un seul achat sur toutes les plateformes Apple et qui transcrivent des enregistrements terminés plutôt que d’animer des réunions.
À garder en tête : elle exige désormais iOS 26 ou ultérieur, l’iPhone reçoit un Whisper plus petit que le Mac, et il n’y a ni détection des intervenants, ni transcription en direct, ni édition dans l’app.
4. Whisper Memos — Whisper, mais dans le cloud
Whisper Memos inverse le flux de travail habituel : vous enregistrez, et la transcription plus un résumé IA automatique arrivent dans votre boîte mail. Elle propose le choix entre OpenAI Whisper et ElevenLabs Scribe, que sa fiche annonce à « jusqu’à 96,7 % de précision » et recommande pour les accents et la parole multilingue. Elle couvre plus de 50 langues et importe les MP3, M4A, WAV, AAC, FLAC et OGG.
La capture est vraiment bien conçue — widget d’écran verrouillé, app Apple Watch avec enregistrement autonome, Siri, Raccourcis et le bouton Action. Les transcriptions sont ensuite acheminées vers Notion, Reflect, Todoist, Things 3, Day One, Evernote, Trello, Drafts et des milliers d’autres outils via Zapier.
La fiche décrit un « enregistrement hors ligne — synchronisé quand vous retrouvez du réseau », et c’est l’indice révélateur : l’enregistrement fonctionne hors ligne, pas la transcription. Votre audio part vers un serveur. Gardez-la sur votre liste si cela convient au contenu que vous enregistrez, et écartez-la sinon.
Idéale pour : le journal vocal et la capture de notes en mode « enregistrer et oublier », où la transcription doit atterrir automatiquement dans votre boîte mail et vos outils en aval.
À garder en tête : traitement cloud, variante de Whisper non précisée, et pas d’app Mac.
Propulsées par Whisper aussi, mais pour un autre travail
Quatre autres apps ressortent d’une recherche sur Whisper pour iOS et méritent d’être nommées pour que vous puissiez les retenir ou les écarter rapidement :
- WhisperBoard (gratuite, open source) — une app iOS construite sur whisper.cpp dans laquelle vous parcourez et téléchargez la taille de modèle Whisper de votre choix, tout s’exécutant localement. La contrepartie est la finition d’un projet open source plutôt que d’un produit abouti, mais c’est le moyen le moins cher d’expérimenter différentes variantes de Whisper sur votre propre téléphone.
- VoicePen (gratuite, 4,7 pour 505 évaluations américaines) — transcription et notes IA « propulsées par OpenAI Whisper », dans le cloud, avec ingestion de liens YouTube, podcast et Zoom plus des intégrations Notion, Zapier et Make.
- V2T: Whisper AI Transcription (gratuite, 4,4 pour 222 évaluations américaines) — inhabituelle car elle propose les deux : transcription en direct sur l’appareil sans internet, et transcription cloud des fichiers importés sur abonnement.
- Superwhisper (gratuite, 4,4 pour 810 évaluations américaines) — une app de dictée plutôt qu’un transcripteur d’enregistrements ; vous apportez vos propres clés API.
Superwhisper, en particulier, résout l’autre problème de la reconnaissance vocale — parler dans un champ de texte au lieu de taper — que nous avons distingué dans le comparatif iOS plus large.
Comment choisir
- Vous voulez le résultat le plus précis que le téléphone puisse produire : LoroNote, pour Large V3 Turbo sur l’appareil.
- Vous enregistrez en chinois, japonais ou coréen : Whisper Notes, pour pouvoir basculer sur SenseVoice pour ces langues.
- Vous avez besoin d’une app Mac et d’un seul paiement : Aiko, en acceptant un modèle plus petit sur le téléphone et l’absence d’étiquettes d’intervenants.
- Vous voulez que les transcriptions arrivent dans votre boîte mail sans ouvrir d’app : Whisper Memos, en acceptant le traitement cloud.
- Vous dictez plutôt que vous ne transcrivez : aucune de celles-ci — regardez plutôt une app de remplacement de clavier.
Ensuite, testez. Enregistrez trois à cinq minutes dans votre environnement habituel avec votre micro, votre accent et quelques noms et termes techniques. Vérifiez les mots manquants, la ponctuation, les changements d’intervenants et le temps écoulé. La taille du modèle explique une grande partie des écarts entre apps ; votre propre audio explique le reste.
Questions fréquentes
Quel modèle Whisper s’exécute sur un iPhone ?
Cela dépend de l’app. LoroNote exécute Whisper Large V3 Turbo sur l’appareil. La fiche d’Aiko indique qu’elle utilise le modèle Whisper medium ou small sur iOS selon la mémoire disponible, et le modèle large-v3 sur macOS. Whisper Notes et Whisper Memos ne précisent pas de variante dans leurs fiches.
Une app Whisper fonctionne-t-elle hors ligne ?
Seulement si elle exécute le modèle sur votre appareil. LoroNote, Whisper Notes et Aiko indiquent toutes trois que la transcription se fait localement, donc elles fonctionnent en mode Avion. Whisper Memos et VoicePen envoient l’audio à un serveur et ont donc besoin d’une connexion pour produire une transcription — Whisper Memos enregistre hors ligne et synchronise plus tard.
Whisper est-il gratuit sur iOS ?
Le modèle est open source, mais les apps le tarifent différemment. LoroNote et Whisper Memos sont des téléchargements gratuits avec achats intégrés. Whisper Notes coûte 6,99 $ une fois. Aiko coûte 24,00 $ une fois. Les apps qui exécutent Whisper localement n’ont aucun coût serveur à la minute, ce qui explique que plusieurs d’entre elles facturent un prix unique plutôt qu’un abonnement.
Quelle est la meilleure app Whisper gratuite pour iPhone ?
Cela dépend de ce que « gratuite » doit inclure. WhisperBoard est réellement gratuite et open source, exécute Whisper localement et vous laisse choisir la taille du modèle — avec les aspérités d’un projet communautaire. V2T propose une voie gratuite de transcription en direct sur l’appareil. LoroNote est un téléchargement gratuit avec achats intégrés, ce qui permet de tester Whisper Large V3 Turbo sur votre propre audio avant de payer quoi que ce soit. Des apps Whisper cloud gratuites existent aussi, mais leurs coûts serveur sont payés d’une manière ou d’une autre — vérifiez ce que plafonne l’offre gratuite et où part votre audio.
À quel point Whisper Large V3 Turbo est-il plus rapide ?
Le tableau de référence d’OpenAI donne à Turbo environ 8× la vitesse de large (qui est la base 1×), avec 809 M de paramètres contre 1 550 M et ~6 Go de VRAM contre ~10 Go. Les notes de publication ajoutent qu’avec les correctifs d’optimisation associés, la vitesse de reconnaissance vocale de Turbo est plus rapide que ce qu’était celle de tiny.
Ce sont des chiffres de référence GPU. Sur du vrai matériel Apple, l’affichage intégré de LoroNote montre un facteur de vitesse d’environ 19× sur un iPhone 15 Pro pour un enregistrement de dix minutes — environ 33 secondes de traitement pour 10,5 minutes d’audio.
Combien de temps faut-il pour transcrire une heure d’audio sur un iPhone ?
Sur un iPhone 15 Pro exécutant Whisper Large V3 Turbo, LoroNote relève environ 19× le temps réel, ce qui place un enregistrement de 60 minutes à environ trois minutes. C’est un chiffre de première main lu sur l’affichage de progression de l’app, pas un benchmark indépendant. D’autres apps publient des chiffres plus bas — la fiche de Whisper Notes équivaut à environ 5× sur sa voie Whisper.
Large V3 Turbo est-il aussi précis que Large V3 ?
Non, et OpenAI ne le prétend pas. Sa position déclarée est que Turbo « obtient des résultats similaires à large-v2 » toutes langues confondues, avec une dégradation plus marquée sur le thaï et le cantonais en particulier. Turbo n’est pas non plus entraîné pour la traduction, car les données de traduction ont été exclues de son affinage. Il échange un cran de précision contre environ 8× la vitesse de décodage.
Pourquoi Turbo réduit-il le décodeur plutôt que l’encodeur ?
L’encodeur de Whisper s’exécute une fois par fenêtre audio de 30 secondes, tandis que le décodeur s’exécute une fois par token produit. Sur les longs enregistrements, le décodeur domine le temps de traitement total, donc le faire passer de 32 couches à 4 supprime l’essentiel du coût. Laisser l’encodeur intact est ce qui préserve la qualité acoustique multilingue de large-v3.
Un modèle Whisper plus grand est-il toujours meilleur ?
Pas toujours. Les variantes plus grandes sont généralement plus précises, surtout sur les accents, le bruit de fond et les langues moins courantes, mais elles utilisent plus de mémoire et prennent plus de temps sur le même enregistrement. Turbo existe précisément pour rendre un modèle de la série Large assez rapide pour un téléphone. Pour de l’audio anglais propre, un modèle plus petit produit souvent un texte que vous ne pourriez pas distinguer.
Utiliser Whisper signifie-t-il que mon audio part chez OpenAI ?
Non. Whisper est open source et peut s’exécuter entièrement sur votre appareil — c’est ce que font LoroNote, Whisper Notes et Aiko. Une app peut aussi appeler une API Whisper hébergée, auquel cas l’audio quitte bel et bien votre appareil — mais c’est l’architecture de l’app, pas une propriété du modèle.
Quelle app Whisper identifie les intervenants ?
LoroNote et Whisper Notes fournissent toutes deux des étiquettes d’intervenants avec renommage. La fiche d’Aiko indique que la détection des intervenants n’est pas disponible actuellement.
Le mot de la fin sur le choix d’une app Whisper pour iOS
« Propulsée par Whisper » est devenu un badge plutôt qu’une spécification. Quatre apps peuvent l’arborer en toute vérité tout en exécutant des tailles de modèle différentes, sur des matériels différents, avec votre audio à des endroits complètement différents.
Les deux questions qui valent la peine d’être posées sont celles auxquelles l’étiquette ne répond pas : quelle variante, et exécutée où. Aiko répond aux deux dans sa fiche et mérite d’en être créditée. LoroNote exécute la plus grande variante que l’une de ces apps met sur un téléphone, et l’exécute localement. Whisper Notes vous donne trois moteurs interchangeables pour le prix d’un café. Whisper Memos est un bon produit qui se trouve être un service cloud portant le même mot.
Choisissez d’après ces deux faits, pas d’après le badge.
Sources
- LoroNote sur l’App Store
- Whisper Notes sur l’App Store
- Aiko sur l’App Store
- Whisper Memos sur l’App Store
- Notes de publication d’OpenAI Whisper Large V3 Turbo
- Tableau des modèles OpenAI Whisper
- whisper.cpp par Georgi Gerganov
- WhisperBoard sur GitHub
- Chiffres de vitesse LoroNote : mesurés sur un iPhone 15 Pro, enregistrement de 10 min 31 s, Whisper Large V3 Turbo sur l’appareil, relevés sur l’affichage de progression de l’app
Votre voix devient du texte — hors ligne
LoroNote transcrit réunions, cours et interviews directement sur votre iPhone — privé, précis et illimité.
Télécharger sur l’App Store