Cómo mejorar la precisión de la transcripción: cinco factores, en orden (2026)
LoroNote Team13 min

Índice
- Los cinco factores, ordenados por efecto medido
- Factor 1: la distancia del micrófono — el que multiplica el error por cinco
- Factor 2: voces superpuestas
- Factor 3: ruido, música y silencio
- Factor 4: idioma, acento y vocabulario
- Factor 5: la variante del modelo — lo único que decide el software
- Lo que no ayuda tanto
- Mide la mejora, no la confíes a la sensación
- Preguntas frecuentes
- Reflexión final sobre mejorar la precisión de la transcripción
- Fuentes
Respuesta rápida: la precisión de la transcripción se decide, en su mayor parte, antes de que se ejecute ningún software. Las mediciones publicadas ordenan los factores así: distancia del micrófono y acústica de la sala (el mismo modelo puntero que obtiene un 2–3 % de tasa de error de palabras con micrófono cercano ronda el 16 % en reuniones con micrófono lejano: el error se multiplica por cinco), voces superpuestas (la razón principal de que los corpus de reuniones queden últimos en todos los benchmarks), ruido y silencios largos (el silencio es donde los modelos de voz alucinan texto que nadie dijo), idioma y vocabulario (las tasas de error por idioma publicadas se separan por más de un factor de diez) y, por último, la variante del modelo — lo único que depende solo del software. Cada afirmación de abajo va acompañada de su cifra medida.
Esta guía la escribió el equipo de LoroNote el 27 de agosto de 2026. Todas las cifras de benchmark salen de las fuentes primarias recopiladas en nuestra página de estadísticas de transcripción verificadas (en inglés); el método de medición del final viene de nuestra guía de la tasa de error de palabras. LoroNote ejecuta Whisper Large V3 Turbo en el dispositivo, así que mejorar tus condiciones de grabación mejora la salida de nuestro propio producto — no tenemos ningún incentivo para decirte que la precisión ya está bien como está.
Los cinco factores, ordenados por efecto medido
| Factor | La evidencia medida | Lo que tú controlas |
|---|---|---|
| 1. Distancia del micrófono | ~2–3 % de WER con micrófono cercano vs ~16 % en reuniones con micrófono lejano (mismo modelo) | Dónde colocas el teléfono |
| 2. Voces superpuestas | Los corpus de reuniones con voces cruzadas quedan últimos en todos los benchmarks | Turnos de palabra, dónde se sienta cada uno |
| 3. Ruido y silencio | Los modelos se degradan bruscamente por debajo de ~10 dB de SNR; las alucinaciones se concentran en el silencio | Entorno, recortar los silencios |
| 4. Idioma y vocabulario | Los WER por idioma publicados van del 4,3 % al 55,7 %; los nombres y la jerga fallan primero | Diccionario personalizado, vocalizar |
| 5. Variante del modelo | Whisper Small acumuló aproximadamente el doble de errores que los motores de clase Large en una misma pasada | Qué app usas — lo único puramente software |
El orden importa. Quien busca una app mejor está tocando el factor 5, cuando el daño real lo hacen los factores 1 a 3.

Un micrófono dinámico de escenario — pero lo decisivo no es el equipo, sino lo cerca que está de la voz cualquier micrófono, incluido el del teléfono. Fuente:
Wikimedia Commons (E bailey)
, CC BY-SA 4.0.
Factor 1: la distancia del micrófono — el que multiplica el error por cinco
El factor que más pesa, con diferencia, es a qué distancia de la boca está el micrófono. La demostración publicada más limpia es un solo modelo medido en varias condiciones: Whisper Large V3 promedia alrededor del 7,4 % de WER sobre ocho conjuntos de prueba reales y variados en inglés, en torno al 2–3 % en voz leída limpia con micrófono cercano — y alrededor del 16 % en el corpus AMI, grabado en salas de reuniones con micrófonos lejanos. Entre una cifra y otra no cambió nada del software.
Qué hacer en la práctica:
- Antes de gastar en equipo, mueve el teléfono. Un teléfono apoyado cerca de quien habla rinde más que un equipo caro al otro lado de la sala. En una entrevista de dos personas, el teléfono va entre ambas, algo más cerca de la voz más baja.
- En reuniones, pon el dispositivo en el centro de la mesa, no en tu sitio. Cada metro de más hasta el hablante más alejado cuesta más de lo que recuperará cualquier cambio de app.
- Si dictas a solas, ya partes con ventaja. Un teléfono a un brazo de distancia es, en la práctica, micrófono cercano — el mejor escenario posible. Si aun así tus grabaciones salen mal transcritas, el problema está en los factores de abajo, no en la distancia.
Factor 2: voces superpuestas
Las voces cruzadas son la segunda razón de que el audio de reuniones quede último en los benchmarks. Cuando dos personas hablan a la vez no hay señal limpia que transcribir: el modelo tiene que elegir una voz, y cada palabra de la otra se convierte en un error. Es un problema de física antes que de software, y por eso ninguna mejora de modelo lo elimina.
Qué hacer en la práctica:
- Hablar de uno en uno vale más que cualquier ajuste. En las reuniones que tú diriges, dejar que cada persona termine su frase mejora la precisión más que cualquier opción del menú.
- Sienta las voces importantes cerca del micrófono. Si quien decide murmura desde la esquina del fondo, esa esquina es exactamente donde fallará la transcripción.
- Cuenta con que las etiquetas de hablante también sufren cuando las voces se solapan. Identificar quién dijo qué es un paso aparte, con sus propias formas de fallar — cómo funciona la identificación de hablantes explica dónde se rompe. Una transcripción puede acertar todas las palabras y aun así atribuirlas a la persona equivocada en los tramos con voces cruzadas.
Factor 3: ruido, música y silencio
El ruido de fondo constante degrada la transcripción de forma gradual; las propias pruebas de robustez del paper de Whisper muestran el reconocimiento desplomándose cuando el ruido añadido pasa de la marca de unos 10 dB de relación señal-ruido — el nivel de una cafetería o un bar ruidosos, donde los modelos de la competencia se degradaban aún más rápido que Whisper. La música es peor que el ruido por una razón más sutil: los modelos de voz entrenados con corpus enormes de la web han visto muchísima música con letra, e intentarán transcribirla.
El silencio esconde su propia trampa. Un estudio de 2024 sobre la API de Whisper encontró frases alucinadas en aproximadamente el 1 % de las transcripciones — oraciones inventadas concentradas donde el audio se queda en silencio, y desproporcionadamente en el habla de personas que hacen pausas más largas. (Las inserciones nacidas del silencio son también la razón de que una tasa de error de palabras pueda superar el 100 %.)
Qué hacer en la práctica:
- Elige la sala más silenciosa antes que el micrófono mejor. Un teléfono en una sala tranquila gana a un buen micrófono en una ruidosa.
- Apaga la música de fondo cuando una grabación importe. Es ruido que enmascara y, a la vez, texto que compite.
- Recorta los tramos largos de silencio antes de transcribir, o graba por segmentos — el silencio no es un relleno inocuo; es donde aparece el texto inventado. Y al revisar, lee con desconfianza los pasajes que corresponden a momentos de silencio.
Factor 4: idioma, acento y vocabulario
Las cifras por idioma publicadas para el mismo modelo de Whisper se separan por más de un factor de diez — del 4,3 % (neerlandés) al 55,7 % (albanés) en Common Voice 15. Las brechas por acento son reales y están documentadas: una investigación revisada por pares midió una tasa de error media del 35 % para hablantes negros estadounidenses frente al 19 % para hablantes blancos en cinco sistemas comerciales, con pruebas de 2019. Ningún ajuste te saca de los datos con los que se entrenó el modelo — pero dos cosas sí están de verdad en tu mano:
- Los nombres, la jerga y los términos de producto fallan primero, y fallan siempre igual. El modelo nunca ha visto el nombre de tu cliente, así que dará la misma respuesta equivocada cada vez. Es el único problema de precisión con solución directa: el diccionario personalizado de LoroNote sirve justo para enseñarle los términos recurrentes una sola vez, y a partir de ahí el modelo deja de adivinar.
- Pronuncia con claridad los números, los nombres y los códigos. Es un hábito que no cuesta nada y protege exactamente las palabras cuyos errores más caros resultan — en un benchmark, una fecha destrozada y una muletilla destrozada cuentan lo mismo; en tu trabajo, no.
- Si tu idioma sale mal parado en los gráficos publicados, una prueba de dos minutos con tu propio audio te dirá más que cualquier tabla — el gráfico por idioma, y por qué algunos idiomas se puntúan con CER en lugar de WER, están en la guía del WER.
Factor 5: la variante del modelo — lo único que decide el software
Cuando el audio ya es todo lo bueno que las circunstancias permiten, queda una sola cosa: qué modelo ejecuta tu app. Y la diferencia no es sutil. En el único benchmark que los midió en las mismas condiciones, Whisper Small obtuvo un 3,74 % en LibriSpeech test-clean y un 7,95 % en test-other, mientras que los motores de clase Large quedaban cerca del 2 % y el 4,5 % — más o menos la mitad de errores, por una decisión de tamaño de modelo que la app tomó por ti. El «Powered by Whisper» de una ficha de app abarca tamaños cuya precisión difiere en un factor de dos, y varias apps de iOS cargan sin decirlo los tamaños pequeños.
Qué hacer en la práctica: antes de cambiar de app por precisión, comprueba qué variante carga realmente cada una. LoroNote ejecuta Whisper Large V3 Turbo — de la familia Large — en el dispositivo; en un iPhone 15 Pro transcribe a unas 19 veces el tiempo real (medición nuestra), así que la precisión de un modelo grande no te obliga a esperar.
Lo que no ayuda tanto
Tres arreglos a los que la gente recurre y que la evidencia no respalda:
- Grabar a una frecuencia de muestreo más alta. Whisper remuestrea todo el audio a 16 000 Hz antes de escucharlo — el paper lo dice explícitamente. Un archivo de estudio a 96 kHz y una nota de voz corriente llegan al modelo con el mismo aspecto; invierte el esfuerzo en distancia y silencio.
- Un teléfono más nuevo. El micrófono de cualquier iPhone reciente no es el cuello de botella; su posición sí. (Un teléfono más nuevo puede transcribir más rápido, que es otra propiedad.)
- Filtros de «mejora» antes de transcribir. Una eliminación de ruido agresiva puede emborronar la estructura armónica que el modelo lee. Si usas uno, compruébalo contando errores antes y después sobre el mismo clip, en lugar de fiarte de que el audio suene más limpio — lo que suena mejor a tu oído no es necesariamente más legible para el modelo.
Mide la mejora, no la confíes a la sensación
Cada factor de arriba se puede poner a prueba en diez minutos: graba dos minutos con tu configuración actual, transcribe y cuenta los errores en un tramo de 200 palabras con reglas fijas; después cambia una sola cosa — acerca el teléfono, apaga la música — y repite el mismo pasaje. El método de recuento completo, incluida la decisión previa de qué cuenta como error, está en nuestra guía del WER. Como LoroNote transcribe en el dispositivo y los primeros dos minutos de cada grabación son gratis, el experimento no cuesta nada y funciona incluso con el modo Avión activado.
Preguntas frecuentes
¿Por qué mi transcripción es tan imprecisa?
Repasa los factores en orden: a qué distancia estaba el micrófono de los hablantes, si la gente habló a la vez, cuánto ruido había en la sala y cuánto silencio contiene la grabación, si las palabras que fallan son sobre todo nombres y jerga y, por último, qué modelo ejecuta tu app. En los benchmarks publicados, la distancia del micrófono basta por sí sola para mover el mismo modelo de aproximadamente un 2–3 % a alrededor de un 16 % de tasa de error — una brecha que ningún cambio de app recupera.
¿Un micrófono externo mejora la precisión de la transcripción?
Lo que mejora la precisión es la distancia; un micrófono externo es una forma de ganarla. Un micrófono de solapa sobre quien habla equivale, en la práctica, a micrófono cercano incluso en una sala grande. Pero un teléfono bien colocado consigue casi el mismo efecto gratis — primero la posición, después el equipo.
¿La música de fondo afecta a la transcripción?
Sí, por partida doble: enmascara la voz como cualquier ruido y, como los modelos de voz han visto cantidades enormes de audio con letra, pueden transcribir la canción en lugar de a quien habla. El reconocimiento también se degrada bruscamente cuando el ruido pasa del nivel de unos 10 dB de relación señal-ruido de una cafetería ruidosa. Apaga la música en las grabaciones que importen.
¿Puedo arreglar los errores de acento con un ajuste?
Con un ajuste, no — cómo maneja un modelo cada acento depende de sus datos de entrenamiento, y la investigación ha documentado brechas demográficas reales. Lo que sí está en tu mano: elegir una app que ejecute un modelo de clase Large (los modelos grandes asimilan mejor la variación), registrar los nombres y términos recurrentes en un diccionario personalizado y medir con tus propios dos minutos en lugar de fiarte de promedios obtenidos con las voces de otros.
¿Las grabaciones más largas se transcriben peor?
No hay evidencia de que la duración en sí reste precisión — lo que importa son las condiciones. Una clase de tres horas grabada de cerca y en silencio se transcribe igual de bien que sus primeros diez minutos. Lo que sí crece con la duración es el trabajo de revisar los errores, y por eso las mejoras de arriba importan más cuanto más largas son tus grabaciones.
Reflexión final sobre mejorar la precisión de la transcripción
Los consejos de precisión suelen apuntar al software porque el software es lo fácil de cambiar. Las mediciones apuntan en la dirección contraria: el error que se multiplica por cinco viene de la distancia del micrófono y de la sala, los fallos más tercos vienen de las voces cruzadas y del silencio, y lo único que de verdad decide el software es la variante de modelo que carga tu app. Acerca el teléfono, busca una sala tranquila, respeta los turnos de palabra, regístrale tus nombres, comprueba el modelo — en ese orden — y confirma cada cambio contando errores antes y después sobre tu propia grabación, porque la única cifra de precisión que importa es la tuya.
Fuentes
- AI transcription statistics: every number verified (en inglés) — las fuentes primarias y fechas de verificación de todas las cifras de benchmark usadas arriba
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — el remuestreo a 16 000 Hz; robustez ante ruido añadido (degradación por debajo de ~10 dB de SNR con ruido de bar)
- Open ASR Leaderboard — cifras de benchmarks mixtos y de salas de reuniones AMI
- Koenecke et al., Racial disparities in automated speech recognition (PNAS, 2020) — la brecha medida de acento y dialecto
- Koenecke et al., Careless Whisper: Speech-to-Text Hallucination Harms (2024) — la alucinación sobre el silencio
- Lyonesse, Apple’s New Speech API vs Whisper — la pasada lado a lado de Small frente a clase Large
- LoroNote, ¿Qué es la tasa de error de palabras? — el método de medición para las pruebas de antes y después
Cifras contrastadas con las fuentes enlazadas el 26 y 27 de agosto de 2026.
Tu voz se convierte en texto — sin conexión
LoroNote transcribe reuniones, clases y entrevistas directamente en tu iPhone — privado, preciso e ilimitado.
Descargar en el App Store