IA

Transcription IA sur l’appareil : comment l’iPhone exécute Whisper (2026)

LoroNote Team11 min

La transcription IA sur l’appareil, c’est le modèle de reconnaissance vocale qui s’exécute sur le téléphone lui-même — votre audio n’a aucune étape d’envoi à franchir. Ce qui se passe réellement entre le micro et le texte, le rôle du Neural Engine, pourquoi c’est la mémoire (et non la puissance de calcul) qui décide du modèle que charge votre application, et ce que la transcription sur l’appareil ne sait vraiment pas faire.

Réponse rapide : la transcription IA sur l’appareil signifie que le modèle de reconnaissance vocale s’exécute sur les processeurs de votre propre téléphone — l’enregistrement devient du texte sans être envoyé nulle part. L’argument de confidentialité est architectural plutôt que contractuel : il n’existe aucune étape d’envoi que votre audio pourrait emprunter, et vous pouvez le vérifier vous-même en transcrivant en mode Avion. « Sur l’appareil » ne veut pas dire moins précis — les mêmes poids de modèle produisent la même transcription où qu’ils s’exécutent. Ce que cela impose, en revanche, c’est un budget matériel : c’est la mémoire du téléphone, et non sa puissance de calcul, qui décide de la taille de modèle qu’une application peut charger — voilà pourquoi certaines applications exécutent discrètement les petites variantes de Whisper, alors que d’autres parviennent à loger un modèle de la famille Large. Voici ce qui se passe réellement entre le micro et le texte.

Ce guide a été écrit par l’équipe LoroNote le 27 août 2026. LoroNote exécute Whisper Large V3 Turbo entièrement sur l’appareil : cet article décrit donc les rouages sur lesquels repose notre propre produit. Chaque chiffre de benchmark renvoie à une source primaire, la plupart rassemblées dans notre page de statistiques vérifiées sur la transcription (en anglais) ; la seule mesure qui vient de nous est signalée comme telle.

Ce que « sur l’appareil » veut vraiment dire

Tous les services de transcription font la même chose ; ce qui change d’une architecture à l’autre, c’est l’endroit où se trouve le modèle.

ÉtapeTranscription dans le cloudTranscription sur l’appareil
EnregistrementSur votre téléphoneSur votre téléphone
EnvoiL’audio part vers les serveurs du prestataireN’existe pas
Modèle vocalS’exécute sur des GPU serveurS’exécute sur les processeurs du téléphone
RésultatLe texte revient par le réseauLe texte est écrit localement
Fonctionne hors ligneNonOui — rien n’exige de connexion
Qui peut accéder à l’audioVous + l’infrastructure du prestataireCelui qui tient le téléphone

Les deux dernières lignes sont celles qui comptent. Le fonctionnement hors ligne n’est pas une fonctionnalité ajoutée à la transcription sur l’appareil ; c’est un effet secondaire de l’architecture — rien, dans le pipeline, n’a besoin du réseau. Et la propriété de confidentialité fonctionne de la même manière : un audio jamais envoyé ne peut être ni conservé, ni divulgué, ni consulté par un prestataire — non parce qu’une politique le promet, mais parce qu’il n’existe tout simplement aucune copie. C’est un énoncé d’architecture, pas une garantie juridique — ce qu’il implique pour vos propres obligations relève de votre appréciation, mais le fait technique, lui, se vérifie en mode Avion.

Le pipeline : ce qui se passe entre le micro et le texte

Les modèles vocaux modernes comme Whisper d’OpenAI traitent l’audio en quelques étapes concrètes, qui s’exécutent toutes localement dans une application sur l’appareil :

  1. Le rééchantillonnage. L’audio est converti à 16 000 Hz — l’article indique que tout l’audio d’entraînement est rééchantillonné à cette fréquence, si bien que tout ce qui la dépasse est écarté avant même que le modèle n’écoute. (C’est aussi pourquoi enregistrer à des fréquences de studio n’améliore pas la précision.)
  2. Le spectrogramme. La forme d’onde devient un spectrogramme de Mel — d’après l’article Whisper, une représentation logarithmique calculée sur des fenêtres de 25 millisecondes avec un pas de 10 millisecondes. Le modèle ne « voit » jamais de son ; il lit cette carte, proche d’une image, des fréquences qui portent de l’énergie au fil du temps.
  3. L’encodage. Un encodeur Transformer digère le spectrogramme en une représentation interne de ce qui a été dit acoustiquement.
  4. Le décodage. Un décodeur Transformer écrit la transcription token par token, en s’appuyant à la fois sur la représentation de l’audio et sur le texte déjà produit — c’est pourquoi Whisper se lit avec fluidité, et aussi pourquoi il peut inventer du texte fluide sur du silence.

Aucune de ces étapes ne se soucie de l’endroit où elle s’exécute. Un GPU de serveur et un téléphone effectuent les mêmes mathématiques sur les mêmes poids — c’est précisément pour cela que la transcription sur l’appareil est devenue possible dès que les puces de téléphone ont rattrapé leur retard.

Le matériel : ce que fait le Neural Engine

Les puces de téléphone ont cessé d’être de simples CPU il y a des années. Les systèmes sur puce de la série A d’Apple embarquent, à côté du CPU et du GPU, un bloc dédié au calcul de réseaux de neurones — le Neural Engine — et l’annonce de l’iPhone 15 Pro par Apple décrivait celui de l’A17 Pro comme jusqu’à deux fois plus rapide que son prédécesseur. Les applications de transcription du commerce convertissent leurs modèles au format Core ML d’Apple pour que ce matériel exécute efficacement l’encodeur et le décodeur.

Illustration d’un système sur puce Apple A16 Bionic

Illustration d’un système sur puce Apple de la série A. Aux côtés du CPU et du GPU, ces puces embarquent un Neural Engine dédié — le bloc qui exécute les mathématiques du modèle vocal sur l’appareil. Source :

Wikimedia Commons (Henriok)

, CC0.

La contrainte pratique, pourtant, n’est pas la vitesse de calcul du silicium — c’est la taille de modèle qui tient en mémoire. Le tableau publié par OpenAI rend l’enjeu concret (paramètres et empreintes de référence, mesurés sur un GPU serveur) :

Variante WhisperParamètresMémoire de référenceVitesse relative (A100)
tiny39 M~1 Go~10×
base74 M~1 Go~7×
small244 M~2 Go~4×
medium769 M~5 Go~2×
large1 550 M~10 Go
turbo809 M~6 Go~8×

Deux réserves honnêtes s’imposent sur ce tableau. Les colonnes mémoire et vitesse sont les chiffres de référence d’OpenAI pour l’inférence sur GPU — un téléphone n’a pas de VRAM séparée, et les applications, elles, quantifient les modèles pour Core ML, ce qui change à la fois l’empreinte et le débit. Lisez ce tableau comme la relation entre les variantes, pas comme la fiche technique d’un téléphone. Mais cette relation est exactement le sujet : un téléphone loge une petite variante sans effort et un modèle de la famille Large seulement au prix d’un vrai travail d’ingénierie — voilà pourquoi plusieurs applications iPhone connues chargent discrètement small ou medium alors que leurs versions de bureau exécutent large. Whisper Large V3 Turbo — 809 millions de paramètres, avec un décodeur ramené de 32 couches à 4 — existe précisément pour faire tenir la précision de la famille Large dans ce budget ; nous avons expliqué pourquoi LoroNote l’a choisi.

La transcription sur l’appareil perd-elle en précision ?

Non — et c’est l’idée reçue la plus tenace à son sujet. Les poids d’un modèle sont des mathématiques déterministes : la même variante produit la même qualité de transcription sur un téléphone que sur un serveur. « Sur l’appareil » n’est pas un mode dégradé.

Ce qui varie d’une application à l’autre, c’est la variante chargée, et cette différence est grande — d’après les chiffres publiés, les petites variantes de Whisper font environ deux fois plus d’erreurs que les moteurs de la famille Large sur le même benchmark. La question de la précision n’a donc jamais été « cloud ou appareil ? ». Elle devient : « quel modèle ? » — une question à poser à chaque application, une par une. Les chiffres mesurés, de la parole lue propre aux salles de réunion, sont dans Quelle est la précision de Whisper ?

Et la vitesse, en pratique ?

Un chiffre ici est le nôtre, nous le signalons donc : sur un iPhone 15 Pro, LoroNote transcrit à environ 19 fois le temps réel — un enregistrement d’une heure devient du texte en trois minutes environ, entièrement sur l’appareil (mesure LoroNote, 13-08-2026). Pour situer un autre moteur sur l’appareil : le benchmark du SpeechAnalyzer d’iOS 26 a rapporté un débit d’environ 12 à 40 fois le temps réel sur un M2 Pro de bureau — avec d’importantes réserves sur ce que ce benchmark a testé, et n’a pas testé.

La vitesse sur l’appareil a une propriété que la vitesse du cloud n’aura jamais : elle est à vous. Pas de file d’attente, pas de quota, pas de compteur à la minute — le coût marginal d’une heure de transcription en plus, c’est de la batterie, pas une facture.

Ce que la transcription sur l’appareil ne sait vraiment pas faire

Une définition honnête inclut les limites :

  • Le modèle ne progresse qu’avec les mises à jour de l’application. Un prestataire cloud peut basculer vers un meilleur modèle côté serveur du jour au lendemain ; une application sur l’appareil livre son modèle avec elle, si bien que les améliorations arrivent avec les mises à jour — jamais en douce.
  • Les gros traitements par lots restent l’affaire du gros matériel. Transcrire des centaines d’heures pour des archives de recherche ira plus vite sur un GPU de bureau ou une file cloud payante que sur n’importe quel téléphone.
  • Tout ce qui est multi-utilisateurs par nature exige un serveur. Une transcription partagée en direct, que dix personnes corrigent pendant un appel, relève de la coordination, pas de la transcription — les cas où un service cloud reste le bon choix sont traités dans le guide de la transcription hors ligne.
  • Un calcul soutenu consomme la batterie. La transcription se fait une fois par enregistrement, pas en continu, mais un long fichier représente un vrai travail pour la puce — brancher le téléphone pour un lot de trois heures est raisonnable.

Aucune de ces limites ne remet en cause l’essentiel : pour vos enregistrements personnels — réunions, cours, entretiens, notes —, le travail se fait sur du matériel que vous possédez déjà, avec la précision du modèle que vous avez choisi, sans que rien ne quitte l’appareil.

Questions fréquentes

La transcription sur l’appareil est-elle vraiment confidentielle ?

Sa confidentialité tient à l’architecture : le pipeline ne contient aucune étape d’envoi, il n’existe donc nulle part une copie de votre audio qui puisse être conservée ou divulguée. Vous pouvez vérifier l’architecture vous-même — activez le mode Avion et transcrivez. Ce que cela implique pour vos propres obligations de confidentialité reste un jugement qui vous appartient ; l’affirmation technique se limite à ceci : l’audio ne quitte pas le téléphone.

La transcription sur l’appareil fonctionne-t-elle hors ligne ?

Oui, par construction — rien dans le pipeline n’a besoin du réseau. Le modèle se télécharge une fois avec l’application ; ensuite, enregistrement et transcription fonctionnent dans un sous-sol, en avion ou en mode Avion.

La transcription sur l’appareil est-elle moins précise que dans le cloud ?

Pas à cause de l’endroit où elle s’exécute — des poids identiques produisent une qualité identique partout. Les écarts de précision entre applications viennent de la variante de modèle que chacune charge, et c’est la pression mémoire du téléphone qui pousse certaines applications vers les petites variantes. Vérifiez la variante, pas le lieu.

Pourquoi certaines applications iPhone exécutent-elles de plus petits modèles Whisper ?

La mémoire. Le tableau de référence d’OpenAI s’étend de 39 millions à 1,55 milliard de paramètres, et les grandes variantes réclament plusieurs gigaoctets avant même de parler des contraintes d’un téléphone. Loger un modèle de la famille Large sur un téléphone demande une ingénierie délibérée — quantification, conversion Core ML, une architecture optimisée pour la vitesse comme le décodeur à quatre couches de Turbo — et toutes les applications ne font pas cet investissement.

La dictée intégrée d’Apple est-elle aussi de la transcription IA sur l’appareil ?

De plus en plus, oui. Le SpeechAnalyzer d’iOS 26 s’exécute entièrement sur l’appareil, comme une application Whisper sur l’appareil — les différences tiennent à la couverture et aux conditions d’accès : le moteur d’Apple prenait en charge 22 langues en août 2026 contre environ 100 pour Whisper, et il exige iOS 26. Nous avons comparé les deux moteurs en détail.

La transcription sur l’appareil vide-t-elle la batterie ?

La transcription est un pic de calcul ponctuel, pas une consommation d’arrière-plan — elle tourne quand vous transcrivez et s’arrête quand le texte est prêt. Les enregistrements courts sont négligeables ; pour des lots de plusieurs heures, traitez-la comme n’importe quelle tâche lourde et branchez le téléphone.

Transcription IA sur l’appareil : le mot de la fin

La transcription IA sur l’appareil n’est pas la copie au rabais d’un service cloud ; ce sont les mêmes mathématiques, exécutées sur du silicium que vous possédez déjà. La définition à retenir tient en trois points : l’audio n’a aucune étape d’envoi à franchir (vérifiable en mode Avion), la précision est une propriété de la variante de modèle et non du lieu d’exécution, et c’est la mémoire du téléphone — pas sa vitesse — qui décide de la variante qu’une application peut embarquer. Jugez toute application sur l’appareil à l’aune de cette dernière question, car c’est celle à laquelle le marketing ne répond jamais.

Sources

Chiffres revérifiés dans les sources liées le 27 août 2026.

Votre voix devient du texte — hors ligne

LoroNote transcrit réunions, cours et interviews directement sur votre iPhone — privé, précis et illimité.

Télécharger sur l’App Store