
Índice
- La fórmula: tres maneras de equivocarse en una transcripción
- WER frente a «99 % de precisión»
- No todos los errores cuestan lo mismo — y al WER le da igual
- Normalización: por qué un mismo modelo obtiene dos cifras distintas
- Un WER no significa nada sin su conjunto de prueba
- Cuando «palabra» deja de funcionar: CER para japonés, chino y coreano
- Cómo medir tu propio WER en diez minutos
- Preguntas frecuentes
- Reflexión final sobre la tasa de error de palabras
- Fuentes
Respuesta rápida: la tasa de error de palabras (WER, por word error rate) es la vara de medir estándar de la precisión en transcripción. Cuenta las tres maneras en que un transcrito puede equivocarse — una palabra sustituida, una palabra eliminada, una palabra insertada — y divide ese total entre el número de palabras realmente dichas. Un WER del 10 % significa que, más o menos, una de cada diez palabras está mal. La definición esconde tres sorpresas: el WER puede superar el 100 %, el mismo transcrito puede recibir dos puntuaciones distintas según cómo se normalizó el texto antes de contar, y la cifra no significa nada sin saber sobre qué audio se midió. Y para los idiomas que se escriben sin espacios, como el japonés y el chino, la industria cambia a la tasa de error de caracteres (CER) — una métrica distinta que los proveedores suelen citar como si fuera la misma.
Esta guía la escribió el equipo de LoroNote el 26 de agosto de 2026. LoroNote ejecuta Whisper Large V3 Turbo en el dispositivo, así que las cifras de WER deciden qué construimos y qué afirmamos — y cada cifra de abajo sale del paper y las fichas de modelo publicados por OpenAI o del Open ASR Leaderboard público, todos enlazados al final. Ninguna es una medición nuestra.
La fórmula: tres maneras de equivocarse en una transcripción
El WER compara dos textos: la referencia (lo que de verdad se dijo, transcrito por una persona cuidadosa) y la hipótesis (lo que produjo la máquina). Cada diferencia entre ambos cae en una de tres categorías:
- Sustitución (S) — una palabra reemplazada por otra
- Eliminación (D) — una palabra dicha que falta en el transcrito
- Inserción (I) — una palabra del transcrito que nadie dijo
La puntuación es el total de las tres dividido entre el número de palabras de la referencia:
WER = (S + D + I) / N, donde N es el número de palabras dichas — no el número de palabras del transcrito.
Un ejemplo resuelto. Alguien dice: «envía el informe a Priya el viernes temprano» — ocho palabras. El transcrito dice: «envía un informe a Prisha el viernes». Son dos sustituciones (el → un, Priya → Prisha) y una eliminación (temprano): tres errores sobre ocho palabras, un WER del 37,5 %. Fíjate en lo que el ejemplo trae de contrabando: el nombre destrozado es el error que de verdad te costaría algo, y cuenta exactamente lo mismo que el convertido en un. Más sobre esto abajo.
Por qué el WER puede superar el 100 %
Las sustituciones y las eliminaciones tienen tope en la longitud de la referencia — no puedes eliminar más palabras de las que se dijeron. Las inserciones no. Un modelo generativo de voz, ante un tramo de casi silencio, puede inventarse frases enteras, y cada palabra inventada es una inserción contada contra una referencia de casi cero palabras. Eso empuja el WER por encima del 100 %, y no es un error de redondeo sino la fórmula funcionando como está diseñada. También es la razón por la que la alucinación — un comportamiento documentado de Whisper ante silencio, ruido y música — importa más de lo que sugiere su peso en el WER medio; comparamos cómo difieren dos arquitecturas de modelo justo en esto en Parakeet V3 vs Whisper Large V3.
WER frente a «99 % de precisión»
Los proveedores rara vez anuncian una tasa de error; anuncian precisión. La conversión es simple — la precisión es aproximadamente 100 % menos el WER — pero el encuadre hace mucho trabajo en silencio. «99 % de precisión» suena a propiedad del producto. Un WER solo describe un producto sobre un conjunto de prueba concreto, y la pancarta de precisión casi nunca nombra uno. El mismo motor que firma un 97 % en voz leída, limpia y con micrófono cercano puede sacar un 84 % en una reunión con micrófono lejano sin que nada cambie en el software. Una cifra de precisión exacta sin conjunto de prueba adjunto es una decisión publicitaria, no una evaluación.
La regla práctica: cada vez que te encuentres un porcentaje de precisión, réstalo de 100 y pregunta «¿sobre qué audio?». Si la respuesta no está publicada, la cifra no puede compararse con nada — ni siquiera con la cifra del año pasado del mismo proveedor.
No todos los errores cuestan lo mismo — y al WER le da igual
El WER es deliberadamente democrático: un «eh» perdido y el nombre de un medicamento equivocado cuentan una vez cada uno. Esa neutralidad es lo que hace la métrica objetiva y comparable entre sistemas, y también es su limitación más conocida. Un transcrito con cinco muletillas destrozadas y un transcrito con cinco nombres de clientes destrozados tienen WER idénticos y consecuencias muy distintas.
Los equipos de evaluación a veces lo compensan con métricas ponderadas por palabras clave o tasas de error de entidades, pero las cifras de titular que vas a encontrar — en papers, en clasificaciones, en marketing — son casi siempre WER a secas. La consecuencia práctica para quien elige una herramienta de transcripción: después de cualquier prueba, lee los errores reales en lugar de quedarte en el recuento. Dónde caen los errores importa más que cuántos son.
Normalización: por qué un mismo modelo obtiene dos cifras distintas
Antes de contar nada, la referencia y la hipótesis se normalizan: se pasan a minúsculas, se les quita la puntuación, se unifican números, contracciones y grafías — ¿es «veintiséis» un error frente a «26»? Cada evaluación responde a estas preguntas con sus propias reglas, y las reglas mueven la puntuación.
A OpenAI le pareció tan importante que publicó un normalizador de texto hecho a medida junto a Whisper y dedicó un apéndice del paper de Whisper a cómo sus decisiones cambian el WER medido. En un benchmark como LibriSpeech, las diferencias de normalización por sí solas pueden mover la cifra publicada de un modelo más de un punto porcentual — más o menos el mismo tamaño que la distancia que muchas comparaciones directas dicen haber encontrado.
Por eso repetimos una misma cautela por todo este blog, la última vez en la comparación con Apple SpeechAnalyzer: las cifras de WER de dos evaluaciones publicadas por separado son contexto aproximado, no un veredicto. La única comparación limpia son dos sistemas puntuados en la misma pasada, con el mismo audio y el mismo normalizador.
Un WER no significa nada sin su conjunto de prueba
El benchmark de voz más citado, LibriSpeech, está construido con audiolibros de dominio público y dividido en dos mitades cuyos nombres lo dicen todo: test-clean (grabaciones claras, hablantes fáciles) y test-other (el resto, más difícil). Un solo corpus, dos condiciones — y todos los modelos puntúan visiblemente peor en la segunda. Esa estructura es la lección entera del WER en miniatura: el audio forma parte de la cifra.
Las cifras publicadas de los modelos grandes de Whisper hacen el mismo trabajo a escala completa. En voz leída limpia, de un solo hablante, alcanzan alrededor del 2–3 % de WER. Promediado sobre ocho conjuntos de prueba reales y variados en inglés del Open ASR Leaderboard, cerca del 7,4 %. En grabaciones de reunión con micrófono lejano y hablantes superpuestos, en torno al 16 %. En un idioma con pocos recursos como el hindi, las cifras publicadas rondan el 27 %. Los mismos pesos, un orden de magnitud de dispersión — recorrimos esa escalera peldaño a peldaño en ¿Cómo de preciso es Whisper?

Más de veinte años de evaluaciones de NIST, una curva por tarea — habla leída, noticias, conversaciones telefónicas y reuniones nunca convergen en una sola cifra. Fuente:
evaluación Rich Transcription de NIST
(dominio público).
El conjunto de prueba también puede esconder otra trampa: qué modelo se probó en realidad. El benchmark que se hizo viral en 2026 afirmando que el nuevo motor de Apple superaba a Whisper había medido Whisper Small — varios tamaños por debajo de los modelos que las apps en el dispositivo ejecutan de verdad. La cifra del titular era real; la comparación no.
Cuando «palabra» deja de funcionar: CER para japonés, chino y coreano
El WER da por hecho que puedes dividir una frase en palabras con solo mirarla. El japonés y el chino se escriben sin espacios, así que «cuántas palabras tiene esta frase» es en sí una decisión de modelado — dos tokenizadores dan dos recuentos distintos, y la tasa de error hereda el desacuerdo. Para esos idiomas, las evaluaciones cambian a la tasa de error de caracteres (CER): la misma aritmética de sustitución, eliminación e inserción, aplicada por carácter en lugar de por palabra. La propia ficha de modelo de Whisper Large V3 de OpenAI informa CER en lugar de WER para idiomas como el japonés, el chino, el coreano y el tailandés.

Las tasas de error por idioma publicadas por OpenAI para Whisper large-v3 y large-v2 (Common Voice 15, FLEURS). Los idiomas en cursiva — coreano, japonés, mandarín, cantonés, tailandés — se puntúan con CER; el resto, con WER. Fuente:
repositorio de OpenAI Whisper
(licencia MIT).
El coreano es el caso intermedio instructivo: tiene espacios, pero las partículas se pegan a la palabra que acompañan, y hay variación legítima de espaciado que cambia los límites de palabra sin cambiar el significado — así que un recuento por palabras castiga diferencias que ningún lector llamaría errores, y la puntuación por caracteres también es allí la opción más estable.
La advertencia práctica: un CER del 5 % y un WER del 5 % no son la misma afirmación. Las puntuaciones por carácter salen numéricamente más bajas que las puntuaciones por palabra sobre la misma salida, porque una palabra equivocada suele contener todavía varios caracteres correctos. Una tabla de precisión multilingüe que mezcla las dos métricas sin avisar — y muchas lo hacen — no es comparable entre sus propias filas. Esto nos toca directamente: LoroNote transcribe más de 100 idiomas en el dispositivo, y «cómo de preciso es en mi idioma» solo tiene respuesta cuando sabes con qué métrica se mide siquiera tu idioma.
Cómo medir tu propio WER en diez minutos
Todas las cifras de arriba se midieron con el audio de otra persona. La prueba que responde a tu pregunta se ejecuta con el tuyo, y no necesita más herramienta que un editor de texto:
- Graba unos dos minutos de audio representativo. La misma sala, la misma distancia al micrófono, el mismo idioma, nombres y jerga reales — la prueba es tan honesta como la muestra.
- Transcríbelo con la app que estés evaluando.
- Decide tus reglas antes de contar. Este es el paso que todo el mundo se salta, y es el problema de la normalización de arriba en miniatura: ignora la puntuación y las mayúsculas, elige una convención para los números y decide de antemano si las muletillas cuentan. Cualquier regla vale — siempre que la fijes antes de mirar el resultado y la mantengas idéntica cuando pruebes una segunda app.
- Puntúa un tramo de 200 palabras. Compara el transcrito con lo que de verdad se dijo y anota cada sustitución, eliminación e inserción. Divide entre 200. Ese es tu WER, sobre el único benchmark que trató de tu audio desde el principio.
- Después lee los errores. Cinco muletillas destrozadas y cinco nombres de clientes destrozados son la misma puntuación y un día muy distinto. Si los mismos nombres fallan una y otra vez, ese problema concreto tiene un arreglo concreto — el diccionario personalizado de LoroNote existe para los términos que el modelo debe dejar de fallar.
Como LoroNote transcribe en el dispositivo y los primeros dos minutos de cada grabación son gratis, el experimento entero no cuesta nada y la grabación nunca sale de tu iPhone — sin subida, sin cuenta, y el modo Avión no cambia nada.
Preguntas frecuentes
¿Cómo se calcula la tasa de error de palabras?
Suma los tres tipos de error — sustituciones, eliminaciones e inserciones — y divide entre el número de palabras realmente dichas: WER = (S + D + I) / N. N sale de la referencia (lo que se dijo), no del transcrito, y por eso una inserción intensa puede empujar el WER por encima del 100 %.
¿Qué es una buena tasa de error de palabras?
Depende por completo del audio. En voz limpia, con micrófono cercano y un solo hablante, los modelos grandes actuales alcanzan un 2–3 % de WER, cerca del techo práctico; sobre audio real y variado en inglés, entre cifras bajas de un dígito y alrededor del 10 % es un resultado fuerte; en reuniones con micrófono lejano y voces cruzadas, hasta los modelos insignia rondan el 16 %. Un «buen» WER es uno medido sobre audio que se parece al tuyo — un proveedor que cita cifras de voz limpia para un caso de sala de reuniones está respondiendo a otra pregunta.
¿Puede la tasa de error de palabras superar el 100 %?
Sí. Las inserciones no están limitadas por el número de palabras dichas, así que un modelo que inventa texto — por ejemplo, alucinando frases durante un tramo de silencio — puede acumular más errores de los que la referencia tiene palabras. Un WER por encima del 100 % casi siempre señala un problema de inserciones, no de oído.
¿Por qué dos evaluaciones informan WER distintos para el mismo modelo?
Por dos razones, normalmente sumadas: audio de prueba distinto y normalización de texto distinta. Las reglas de normalización — cómo se unifican puntuación, mayúsculas, números y contracciones antes de contar — pueden mover por sí solas una cifra publicada de LibriSpeech más de un punto. Solo dos sistemas puntuados en la misma pasada de evaluación son comparables con limpieza.
¿Es el WER la métrica adecuada para todos los idiomas?
No. Para los idiomas que se escriben sin espacios, como el japonés y el chino, los límites de palabra son ambiguos y las evaluaciones usan la tasa de error de caracteres (CER); al coreano también le suele sentar mejor la puntuación por caracteres. Los valores de CER salen numéricamente más bajos que los de WER sobre la misma salida, así que las dos métricas nunca deben compararse directamente.
¿Mide el WER si los hablantes están bien identificados?
No. El WER puntúa solo las palabras. Atribuirlas a la persona correcta es la diarización, un paso aparte con su propia métrica de error, y un transcrito puede tener un WER bajo mientras atribuye cada línea al hablante equivocado. Cómo funciona la identificación de hablantes cubre esa mitad del problema.
Reflexión final sobre la tasa de error de palabras
La tasa de error de palabras es la cifra más útil del reconocimiento de voz y la más fácil de usar mal. La fórmula es honesta — tres tipos de error entre las palabras dichas — pero cada cifra publicada lleva pasajeros silenciosos: el conjunto de prueba sobre el que se midió, el normalizador que preparó el texto y el cambio de métrica que ocurre cuando el idioma deja de usar espacios. Lee cualquier WER con esas tres preguntas al lado y las cifras se vuelven informativas de verdad. Mejor aún: dedica diez minutos a medir una con tu propio audio — es el único conjunto de prueba que trató de ti desde el principio.
Fuentes
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — el paper de Whisper; el apéndice C cubre el normalizador de texto y su efecto sobre el WER medido
- OpenAI, ficha del modelo whisper-large-v3 — cifras por idioma, informadas como WER o CER según el idioma
- Open ASR Leaderboard — medias en inglés sobre varios benchmarks y cifras de reuniones AMI
- Corpus LibriSpeech ASR — la división test-clean / test-other
- LoroNote, ¿Cómo de preciso es Whisper? Cifras reales — las cifras publicadas de arriba, con sus condiciones
Cifras contrastadas con las fuentes enlazadas el 26 de agosto de 2026.
Tu voz se convierte en texto — sin conexión
LoroNote transcribe reuniones, clases y entrevistas directamente en tu iPhone — privado, preciso e ilimitado.
Descargar en el App Store