
Respuesta rápida: en el benchmark que todo el mundo compartió, el nuevo SpeechAnalyzer en el dispositivo de Apple sí superó a Whisper — 2,12 % de tasa de error por palabra frente a 3,74 % en LibriSpeech test-clean. Pero esa prueba ejecutó Whisper Small, sobre audiolibros en inglés, en un Mac. Nunca probó Whisper Large V3 ni Large V3 Turbo, que son los modelos que una app carga de verdad en el iPhone, y no tocó ninguna reunión, ningún acento ni ninguno de los otros ~99 idiomas de Whisper. El motor de Apple es rápido, preciso y gratuito, dentro de los 22 idiomas que admite. Whisper cubre unas cinco veces más.
Todas las cifras de abajo salen del artículo del propio autor del benchmark, de los papers y las fichas de modelo publicados por OpenAI, del Open ASR Leaderboard o de la documentación para desarrolladores de Apple; están enlazadas al final. Lo escribió el equipo de LoroNote el 23 de agosto de 2026. LoroNote ejecuta Whisper Large V3 Turbo en el dispositivo, así que tenemos algo en juego en esta comparación. Precisamente por eso, cada cifra que aparece aquí es la medición de otra persona, no la nuestra.
Qué es SpeechAnalyzer en realidad
SpeechAnalyzer es el framework de voz que Apple presentó en la WWDC 2025 y lanzó con iOS 26. Sustituye a SFSpeechRecognizer, la API envejecida que sostuvo la mayor parte del dictado de terceros en iOS durante una década.
Hay dos módulos públicos que importan:
SpeechTranscriberconvierte voz en texto.SpeechDetectordetecta en qué tramos de un flujo de audio hay habla.
Todo se ejecuta en el dispositivo. Los recursos de idioma se descargan desde el catálogo de recursos del sistema en lugar de venir incluidos en cada app, y por eso una app que use esta API casi no aumenta su tamaño de descarga. Para los idiomas que SpeechTranscriber no cubre, Apple ofrece DictationTranscriber como alternativa.
Hay un requisito estricto que casi todas las comparaciones se saltan: SpeechAnalyzer necesita iOS 26 o posterior y no es retrocompatible. En un iPhone que siga en iOS 18, sencillamente no existe.
El benchmark que todos citaron
Las cifras que se extendieron por la prensa tecnológica en julio de 2026 salen de una única evaluación hecha por un desarrollador. Esto es lo que midió realmente:
| Condición | Valor |
|---|---|
| Corpus | LibriSpeech — 5559 enunciados (2620 test-clean, 2939 test-other) |
| Audio | Voz leída de audiolibro, un solo hablante, grabación limpia |
| Idioma | solo inglés |
| Hardware | M2 Pro, 32 GB, macOS 26.5.1, todo en el dispositivo |
| Variantes de Whisper probadas | Tiny, Base, Small |
Y los resultados:
| Motor | WER test-clean | WER test-other |
|---|---|---|
| Apple SpeechAnalyzer | 2,12 % | 4,56 % |
| Whisper Small (~460 MB) | 3,74 % | 7,95 % |
| Whisper Base (~140 MB) | 5,42 % | 12,51 % |
| Whisper Tiny (~40 MB) | 7,88 % | 17,04 % |
| SFSpeechRecognizer (antiguo) | 9,02 % | 16,25 % |
De esa tabla conviene decir dos cosas sin rodeos. La ventaja de Apple sobre su propia API antigua es enorme — alrededor de un 75 % menos de errores, y esa es la noticia real para quien construyó sobre SFSpeechRecognizer. Y Apple ganó de verdad a todos los modelos Whisper que se probaron.
El problema es cuáles se probaron.
Tres cosas que el benchmark no midió
1. Los modelos Whisper que las apps ejecutan de verdad
Whisper Small es un modelo de 460 MB. No es lo que carga una app de transcripción seria en un iPhone actual. LoroNote ejecuta Large V3 Turbo: 809 millones de parámetros, con el decodificador reducido de 32 capas a 4 para ganar velocidad.
El benchmark se detuvo antes de Medium, Large y Turbo. Como referencia, hay evaluaciones publicadas que sitúan a Whisper Large V3 en LibriSpeech en torno al 2,0–2,5 % de WER en test-clean y al 3,9–4,3 % en test-other, el mismo terreno que el 2,12 % y el 4,56 % de Apple, o algo mejor.
Toma esa comparación con cuidado. Esas cifras de Whisper vienen de evaluaciones distintas, cada una con su propia normalización de texto, no de un enfrentamiento directo en la misma máquina contra el motor de Apple. Solo la elección de normalización puede mover el WER de LibriSpeech más de un punto — nuestra guía del WER explica cómo ocurre. La conclusión honesta no es «Whisper Large gana». Es que ninguna prueba publicada ha comparado el motor de Apple con los modelos Whisper de los que va realmente la comparación, y que la distancia que sugerían los titulares es un efecto del tamaño de modelo elegido.
2. Cualquier cosa más difícil que un audiolibro de estudio
LibriSpeech es voz leída: una persona, un libro, un buen micrófono y nada de hablar encima. Es el peldaño más bajo de la escalera, y por eso cualquier motor firma ahí su mejor número.
Las grabaciones reales están más arriba. En la escalera de precisión que documentamos para Whisper, ese mismo Large V3 que saca 2–3 % en voz leída limpia promedia cerca del 7,4 % sobre una mezcla de benchmarks reales en inglés y ronda el 16 % en audio de sala de reuniones AMI, con micrófonos lejanos y voces superpuestas.
Nadie ha publicado esos peldaños para SpeechAnalyzer. Hasta que alguien lo haga, un 2,12 % en audiolibro dice muy poco sobre una reunión de cuatro personas grabada desde el centro de la mesa. El autor del benchmark fue claro en esto: su artículo describe el corpus como «voz leída de audiolibro, no reuniones».
3. Noventa y nueve idiomas más
Es la mayor laguna, y el autor la señaló directamente: las cifras «no dicen nada sobre los más de 100 idiomas que admite Whisper».
En agosto de 2026, SpeechTranscriber.supportedLocales devuelve 42 variantes regionales que cubren 22 idiomas:
alemán, árabe, cantonés, chino (simplificado, tradicional, Hong Kong), coreano, danés, español, finés, francés, hebreo, inglés (nueve variantes regionales), italiano, japonés, malayo, neerlandés, noruego (bokmål), portugués, ruso, sueco, tailandés, turco y vietnamita.
Whisper Large V3 cubre alrededor de 100. Las ausencias en la lista de Apple no son casos marginales: no hay hindi, ni polaco, ni checo, ni griego, ni ucraniano, ni indonesio. El portugués aparece solo como pt_BR; no existe variante de Portugal.
Para quien lee esto en español, el punto clave es otro. es_ES, es_MX, es_CL y es_US están todos en la lista de Apple, así que la compatibilidad no es el problema. El problema es que no hay cifras de precisión publicadas en español para ninguno de los dos motores. El benchmark que se citó midió solo inglés, y Apple no publica el WER por idioma. Afirmar hoy que Apple transcribe el español mejor que Whisper, o al revés, es hablar sin base. Dos minutos de tu propia grabación siguen siendo la fuente más sólida.
Apple ha dicho que llegarán más idiomas, así que esta lista quedará desfasada en algún momento. Pero «admitido» y «igual de preciso» son afirmaciones distintas en los dos motores. Por eso conviene contrastar la lista completa de idiomas con tu propio audio en lugar de fiarte de un recuento.
Sobre eso de «tres veces más rápido»
La afirmación de velocidad viajó tan lejos como la de precisión, y lleva la misma nota al pie: se midió contra Whisper Small.
Lo que el benchmark comunicó fue un rango de rendimiento de aproximadamente 12 a 40 veces el tiempo real en un M2 Pro: una hora de audio en unos 1,5 a 5 minutos. El autor retuvo a propósito los tiempos exactos por modelo hasta poder repetir las mediciones con la máquina en reposo.
Ese rango es real y el motor de Apple es rápido. Pero sale de un chip M de sobremesa con 32 GB de RAM, no de un teléfono. En el iPhone, la restricción que manda para cualquier modelo de transcripción es la memoria, no la potencia de cálculo. Es también la razón por la que varias «apps de Whisper» conocidas cargan en silencio small o medium en el teléfono mientras sus versiones para Mac ejecutan large. Recopilamos qué variante carga realmente cada app de iOS.
Cuándo conviene cada uno
Ninguno gana en general. Están hechos para trabajos distintos.
Elige Apple SpeechAnalyzer cuando:
- tu idioma esté entre los 22 admitidos, sobre todo si es inglés;
- tu dispositivo tenga iOS 26 o posterior;
- quieras transcripción en directo, con resultados parciales que se actualizan mientras alguien habla — para eso está diseñada la API;
- no quieras ni descarga de modelo ni coste.
Elige la familia Whisper Large V3 cuando:
- tu idioma quede fuera de la lista de Apple, o tus grabaciones mezclen idiomas en un mismo archivo;
- necesites el mismo comportamiento en dispositivos antiguos: las apps basadas en Whisper funcionan muy por debajo de iOS 26;
- transcribas archivos ya grabados en vez de voz en directo, donde la precisión pesa más que la latencia;
- quieras que la transcripción salga igual sea cual sea la versión del sistema.
No hay comida gratis en ninguna dirección. El motor de Apple se integra antes, no cuesta nada y es excelente dentro de su alcance. El alcance de Whisper es unas cinco veces más amplio, y las variantes Large pagan esa amplitud en tamaño de modelo y tiempo de proceso.
Qué cambia al elegir una app para iPhone
Dos consecuencias prácticas.
Primera: «transcripción con IA» en la App Store significa ya al menos tres cosas distintas. Una app que llama al SpeechAnalyzer de Apple en el dispositivo, una app que ejecuta su propio modelo Whisper en local, o una app que sube tu audio a un servidor. La privacidad, el funcionamiento sin conexión y la cobertura de idiomas no tienen nada que ver entre sí, y las fichas rara vez lo aclaran. Nuestra comparación de apps de voz a texto para iOS las ordena según dónde se procesa el audio.
Segunda: que una app sea «en el dispositivo» ya no dice nada sobre su precisión. Las dos vías son locales. La pregunta pasó de adónde va mi audio a qué modelo, de qué tamaño, en qué idioma.
Pruébalo tú en cinco minutos
Los benchmarks son medias sobre corpus que nunca vas a grabar. Tu propio audio es la única prueba que responde a tu pregunta:
- Graba dos minutos en la sala donde sueles grabar: tu micrófono, tu acento, unos cuantos nombres propios, cifras y términos técnicos.
- Transcríbelo con la transcripción integrada de tu iPhone (Notas de voz en un dispositivo compatible, o cualquier app que use el motor de Apple).
- Transcribe el mismo archivo con una app basada en Whisper.
- Cuenta los errores en un tramo de 200 palabras: cada palabra sustituida, ausente o inventada. Errores ÷ 200 = tu WER. (El método completo, incluido cómo decidir qué cuenta como error, está en nuestra guía del WER.)
Si las dos salen limpias, usa la que te resulte más cómoda. La diferencia suele aparecer en los nombres propios, en el habla superpuesta y en cualquier idioma fuera del grupo mejor dotado, que es justo donde el benchmark dejó de mirar.
Preguntas frecuentes
¿Es Apple SpeechAnalyzer más preciso que Whisper?
Frente a Whisper Small en audiolibros limpios en inglés, sí: 2,12 % contra 3,74 % de WER. Frente a Whisper Large V3 o Large V3 Turbo, nadie ha publicado una prueba directa. Evaluaciones separadas colocan a Large V3 al mismo nivel o algo por delante en el mismo corpus, pero las distintas normalizaciones lo convierten en una comparación aproximada, no en un veredicto.
¿Cuál es más preciso en español?
No hay cifras publicadas. El benchmark más citado midió solo inglés y Apple no difunde el WER por idioma. es_ES, es_MX, es_CL y es_US están en la lista de Apple, así que la compatibilidad no falla. Para la precisión, probar con dos minutos de grabación propia es hoy el único método fiable.
¿Funciona SpeechAnalyzer sin conexión?
Sí. Se ejecuta por completo en el dispositivo y los recursos de idioma se descargan una vez desde el catálogo del sistema. En eso coincide con una app de Whisper local: ninguna de las dos envía tu audio a un servidor.
¿Hace falta iOS 26?
Sí. SpeechAnalyzer requiere iOS 26 o posterior y no es retrocompatible. Las apps basadas en Whisper funcionan en versiones bastante más antiguas, y esa es una de las razones prácticas para tener presentes los dos motores.
¿Alguno identifica quién habla?
La identificación de hablantes es un paso aparte de la transcripción, y ninguno de los dos motores la realiza como parte del reconocimiento de voz. Son las apps las que la añaden encima — cómo funciona la separación de hablantes explica qué implica y dónde falla.
¿Por qué LoroNote usa Whisper y no el motor de Apple?
Por cobertura de idiomas y de dispositivos. LoroNote transcribe unos 100 idiomas, incluidas grabaciones con idiomas mezclados, en dispositivos muy anteriores a iOS 26. El motor de Apple es excelente dentro de sus 22 idiomas, pero no sustituye esa amplitud. Explicamos la elección concreta del modelo en nuestra guía de Whisper Large V3 Turbo.
Fuentes
- Apple, Bring advanced speech-to-text to your app with SpeechAnalyzer — sesión de la WWDC25 que presenta el framework
- Apple, documentación de SpeechTranscriber
- Lyonesse, Apple’s New Speech API vs Whisper: The First Real Benchmark — la evaluación en LibriSpeech, su metodología y sus limitaciones declaradas
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — el paper de Whisper
- OpenAI, ficha del modelo whisper-large-v3 y ficha del modelo whisper-large-v3-turbo
- Open ASR Leaderboard — cifras de benchmarks mixtos y de audio de reuniones AMI
Cifras del benchmark verificadas el 23 de agosto de 2026. La lista de idiomas admitidos por Apple cambia con las actualizaciones del sistema; comprueba SpeechTranscriber.supportedLocales en una versión actual antes de darla por buena.
Tu voz se convierte en texto — sin conexión
LoroNote transcribe reuniones, clases y entrevistas directamente en tu iPhone — privado, preciso e ilimitado.
Descargar en el App Store