¿Qué precisión tiene Whisper? Cifras reales, del audiolibro a la sala de reuniones (2026)
Equipo de LoroNote11 min

Índice
- Qué mide realmente la tasa de error por palabra
- La escalera de la precisión: un modelo, cuatro peldaños
- ¿Qué Whisper? La variante cambia la respuesta
- El idioma mueve la cifra más que cualquier otra cosa del software
- Alucinaciones: el error que el WER subestima
- Qué mueve de verdad la precisión en tus grabaciones
- Cómo medir tú mismo la precisión de Whisper en diez minutos
- Preguntas frecuentes
- Conclusión
- Recursos oficiales
Respuesta rápida: no hay una única cifra de precisión para Whisper — hay una escalera. En voz leída limpia con un solo hablante, los modelos large alcanzan aproximadamente un 2–3 % de tasa de error por palabra (WER), es decir, más de 97 palabras correctas de cada 100. En una mezcla de benchmarks reales en inglés, Whisper Large V3 promedia cerca del 7,4 % de WER. En audio de sala de reuniones, con micrófonos lejanos y hablantes que se solapan, el mismo modelo ronda el 16 %. Y en idiomas con pocos recursos la tasa de error puede volver a triplicarse. Que Whisper sea «preciso» depende del peldaño en el que esté tu grabación — y, en igual medida, de qué variante de Whisper ejecuta realmente la app que usas.
Cada cifra de este artículo procede del artículo científico y las fichas de modelo publicados por OpenAI o del Open ASR Leaderboard público, enlazados en las fuentes del final. Lo escribió el equipo de LoroNote el 19 de agosto de 2026. LoroNote ejecuta Whisper Large V3 Turbo en el dispositivo, así que aquí somos parte interesada — y precisamente por eso nada de lo que sigue es una cifra de marketing propia.
Qué mide realmente la tasa de error por palabra
El WER cuenta las palabras en las que la transcripción falla — sustituidas, omitidas o inventadas — como proporción de las palabras pronunciadas. Un WER del 5 % significa un error cada 20 palabras; un 16 %, uno de cada seis. De la definición se siguen dos cosas:
- Un WER solo significa algo junto al audio en el que se midió. «98 % de precisión» sin un conjunto de prueba con nombre es un eslogan, no una medición. El mismo modelo produce más del 97 % en un audiolibro y un 84 % en una sala de conferencias sin que nada esté mal.
- No todos los errores cuestan lo mismo. Un «eh» omitido y el nombre de un fármaco equivocado cuentan una vez cada uno. El WER es la vara de medir estándar porque es objetivo, no porque capture lo usable que se siente una transcripción — y por eso probar con tu propio audio, como se explica más abajo, vale más que cualquier tabla.
Desglosamos la definición completa — la fórmula, por qué el WER puede superar el 100 %, y el paso de normalización que mueve en silencio las cifras publicadas — en ¿Qué es la tasa de error de palabras?
La escalera de la precisión: un modelo, cuatro peldaños
Estas son cifras publicadas de los modelos large de Whisper en benchmarks estándar:
| Condiciones del audio | Benchmark | WER aproximado | Fuente |
|---|---|---|---|
| Voz leída limpia, un hablante | LibriSpeech test-clean | ~2–3 % | Artículo de Whisper de OpenAI (2,7 %, large) |
| Audio real mixto en inglés, ocho conjuntos | Media del Open ASR Leaderboard | ~7,4 % (Large V3) | Open ASR Leaderboard |
| Salas de reuniones, micros lejanos, solapes | Corpus de reuniones AMI | ~16 % (Large V3) | Open ASR Leaderboard |
| Ejemplo de idioma con pocos recursos | Hindi (Common Voice) | ~27 % (Large V3) | Ficha del modelo openai/whisper-large-v3 |
Lee la escalera de arriba abajo y el patrón es claro: el modelo no empeora — empeora el audio. Dictar a un teléfono junto a la boca se sitúa cerca del peldaño superior. Una entrevista a través de la mesa de una cafetería queda en el medio. Una reunión grabada desde el otro extremo de la mesa cae en el tercer peldaño, antes de haber tomado una sola decisión de software.
¿Qué Whisper? La variante cambia la respuesta
«Con tecnología de Whisper» describe una familia, no un modelo. Whisper se distribuye en tamaños de tiny a large, y la distancia entre ellos es mayor que la distancia entre proveedores:
- Large V3 es el buque insignia en precisión. OpenAI lo entrenó con 1 millón de horas de audio etiquetado débilmente más 4 millones de horas de audio pseudoetiquetado, y reporta un 10–20 % menos de errores que Large V2 en una amplia gama de idiomas.
- Large V3 Turbo es el derivado optimizado para velocidad: 809 millones de parámetros, con el decodificador reducido de 32 capas a 4. OpenAI describe el coste como una «degradación menor de calidad» — en el Open ASR Leaderboard las medias quedan muy cerca (alrededor de 7,8 % frente a 7,4 % de WER medio; en torno a 16,1 % frente a 16,0 % en AMI). Combinado entre idiomas rinde de forma similar a Large V2, y donde más pierde es en unos pocos idiomas como el tailandés y el cantonés. Desmontamos ese equilibrio en nuestra guía de Whisper Large V3 Turbo.
- Small y medium rinden varios puntos más de WER — una brecha real que se ve en una prueba de un párrafo. Esto importa especialmente en el iPhone, porque varias «apps con Whisper» conocidas ejecutan small o medium en el teléfono aunque sus versiones de Mac ejecuten large. Nuestra comparativa de apps con Whisper indica qué variante carga realmente cada app de iOS.
La regla práctica: antes de comparar apps por precisión, comprueba qué Whisper ejecuta cada una. Una app que ejecuta Large V3 Turbo y otra que ejecuta small no ofrecen la misma precisión, digan lo que digan ambas fichas sobre «IA Whisper».
El idioma mueve la cifra más que cualquier otra cosa del software
Los datos de entrenamiento de Whisper están muy sesgados hacia los idiomas con muchos recursos, y su precisión lo refleja. El inglés, el español, el alemán, el japonés, el coreano y otros idiomas bien representados se agrupan cerca de las medias de arriba. Los idiomas con pocos recursos quedan mucho más arriba — la cifra del hindi de la tabla es un ejemplo publicado, y la ficha del modelo de OpenAI señala además un rendimiento desigual entre acentos y dialectos dentro de un mismo idioma.
Whisper Large V3 cubre unos 100 idiomas (el cantonés se añadió con V3), así que «compatible» y «igual de preciso» son afirmaciones distintas. Si tu idioma está fuera del grupo con muchos recursos, el consejo honesto es el mismo que en todo este artículo: pasa una grabación corta tuya y mira el resultado — la lista completa de idiomas te dice qué intentará LoroNote, y dos minutos de tu propio audio te dicen con qué calidad.
Alucinaciones: el error que el WER subestima
La ficha del modelo de OpenAI lo dice sin rodeos: como los modelos se entrenan con datos ruidosos a gran escala, «las predicciones pueden incluir textos que en realidad no se pronunciaron en el audio de entrada (es decir, alucinación)». En la práctica esto aparece con el silencio, el ruido de fondo y la música — Whisper es un modelo generativo y, cuando no hay habla que lo ancle, puede producir frases fluidas que nadie dijo.
Dos cosas lo mantienen manejable:
- Las apps pueden mitigarlo. Una detección de actividad de voz que salta los tramos silenciosos elimina la principal oportunidad del modelo para inventar texto. Es un comportamiento a nivel de app, no un ajuste del modelo, y es una de las diferencias reales entre apps que ejecutan el mismo Whisper.
- Puedes detectarlo. El texto alucinado tiende a aparecer en tramos que sabes que fueron silenciosos — el final de una grabación, una pausa larga. Si el centro de una transcripción es sólido pero a sus silencios les crecieron frases, estás viendo una alucinación, no un error de oído.
Comparamos este comportamiento con un modelo de arquitectura transductora en Parakeet V3 vs Whisper Large V3 — los transductores alucinan menos con el silencio, mientras que Whisper cubre muchos más idiomas; no hay almuerzo gratis.
Qué mueve de verdad la precisión en tus grabaciones
Los benchmarks varían el audio; tus grabaciones varían lo mismo. En orden aproximado de impacto:
- La distancia al micrófono. La palanca más grande. Un teléfono al alcance de la mano sobre la mesa supera a un teléfono al otro lado de la sala por más que cualquier mejora de modelo.
- Ruido y música. El ruido de fondo constante degrada el resultado de forma gradual; la música y los golpes lo hunden de golpe.
- Hablantes que se solapan. Las conversaciones cruzadas son la razón de que los corpus de reuniones ronden el 16 % mientras el audio de un solo hablante ronda el 3 %.
- Vocabulario especializado. Nombres propios, fármacos, tickers y jerga fallan de forma desproporcionada. El diccionario personalizado de LoroNote existe exactamente para esto: términos recurrentes en los que debe dejar de equivocarse.
- La variante del modelo — el único factor de la lista que es puramente una elección de software, y la razón por la que LoroNote ejecuta la variante de Whisper más grande que resulta práctica en un teléfono.
Las etiquetas de hablante merecen una nota: la diarización no cambia el WER, pero cambia que una transcripción con varios hablantes sea usable o no. Una transcripción precisa sin hablantes sigue siendo trabajo pendiente; cómo funciona la identificación de hablantes cubre esa mitad del problema.
Cómo medir tú mismo la precisión de Whisper en diez minutos
Una prueba con tu propio audio vale más que todas las tablas de este artículo:
- Graba unos dos minutos que se parezcan a tu uso real — la misma sala, la misma distancia, el mismo idioma, nombres y jerga de verdad.
- Transcríbelo y lee el resultado contra el audio.
- Cuenta los errores en un tramo de 200 palabras: cada palabra sustituida, ausente o inventada. Errores ÷ 200 = tu WER. (Dos minutos de habla superan con holgura las 200 palabras.)
- Juzga los errores, no solo la cuenta: cinco muletillas mal transcritas y cinco nombres de clientes mal transcritos son el mismo WER, pero no el mismo día de trabajo.
La versión precisa de este método — incluido cómo decidir de antemano qué cuenta como error — está en nuestra guía del WER.
Como LoroNote funciona en el dispositivo y su versión gratuita transcribe los primeros 2 minutos de cualquier grabación — exactamente lo que pide esta prueba —, el test no cuesta nada y la grabación nunca sale de tu iPhone: no hay paso de subida, no hay cuenta, y el modo Avión no cambia nada.
Preguntas frecuentes
¿Es Whisper lo bastante preciso para transcripciones profesionales?
Para grabaciones limpias, con el micrófono cerca y en idiomas con muchos recursos, los modelos large de Whisper producen borradores que la mayoría solo edita ligeramente — el 2–3 % de WER en voz limpia está cerca del techo práctico de los sistemas automáticos. Para reuniones con micrófono lejano, muchas conversaciones cruzadas o casos donde la literalidad es crítica, cuenta con tiempo de revisión: al 16 % de WER, una palabra de cada seis necesita tu atención.
¿Pierde precisión Whisper Large V3 Turbo respecto a Large V3?
Ligeramente. OpenAI califica la degradación de menor, y las medias públicas del leaderboard quedan a bastante menos de un punto en inglés. Combinado entre idiomas, Turbo rinde de forma similar a Large V2, con las mayores pérdidas en unos pocos idiomas como el tailandés y el cantonés. A cambio es drásticamente más rápido — el intercambio que hace práctico un modelo de la serie Large en un teléfono.
¿Por qué mi transcripción contiene frases que nadie dijo?
Eso es una alucinación, un comportamiento documentado de Whisper ante el silencio, el ruido y la música: un modelo generativo sin habla que lo ancle puede producir texto fluido de todos modos. Revisa los tramos silenciosos de tu grabación. Las apps que ejecutan detección de actividad de voz antes de Whisper lo evitan en gran medida — es un comportamiento de la app, no un ajuste del usuario.
¿Ejecutar Whisper en el dispositivo reduce su precisión?
No. Los mismos pesos del modelo producen la misma calidad de transcripción se ejecuten donde se ejecuten; la inferencia en el dispositivo no es un modo degradado. Lo que difiere entre apps es qué variante ejecutan — los servicios en la nube alojan con facilidad los modelos más grandes, mientras que las apps en el dispositivo deben caber en el teléfono, y por eso algunas ejecutan small o medium. LoroNote ejecuta Large V3 Turbo en local, manteniendo un modelo de la serie Large y la privacidad en el dispositivo en la misma app.
Conclusión
«¿Qué precisión tiene Whisper?» tiene una forma, no una cifra: aproximadamente un 2–3 % de WER en voz leída limpia, cerca del 7 % en benchmarks mixtos en inglés, en torno al 16 % en audio de reuniones, y peor en idiomas con pocos recursos — con la alucinación como la letra pequeña que el WER subestima. Las dos decisiones que más mueven tus propios resultados son una física (acerca el micrófono) y una estructural (saber qué variante de Whisper ejecuta tu app). El resto se mide en diez minutos con tu propia grabación, que es el único benchmark que de verdad habla de tu caso.
Recursos oficiales
Tu voz se convierte en texto — sin conexión
LoroNote transcribe reuniones, clases y entrevistas directamente en tu iPhone — privado, preciso e ilimitado.
Descargar en el App Store