
Índice
- Qué significa «en el dispositivo» exactamente
- El proceso: qué pasa entre el micrófono y el texto
- El hardware: qué hace el Neural Engine
- ¿Se pierde precisión al transcribir en el dispositivo?
- ¿Qué velocidad alcanza en la práctica?
- Lo que este enfoque de verdad no puede hacer
- Preguntas frecuentes
- Reflexión final sobre la transcripción con IA en el dispositivo
- Fuentes
Respuesta rápida: la transcripción con IA en el dispositivo significa que el modelo de reconocimiento de voz se ejecuta en los procesadores de tu propio teléfono — la grabación se convierte en texto sin enviarse a ninguna parte. La privacidad es aquí una propiedad de la arquitectura, no de un contrato: no existe ningún paso de subida por el que tu audio pueda viajar, y puedes comprobarlo tú mismo transcribiendo en modo Avión. «En el dispositivo» tampoco significa menos preciso: los mismos pesos del modelo producen la misma transcripción se ejecuten donde se ejecuten. Lo que sí impone es un presupuesto de hardware: la memoria del teléfono, no su potencia de cálculo, decide qué tamaño de modelo puede cargar una app — y por eso algunas apps ejecutan sin decirlo las variantes pequeñas de Whisper mientras otras consiguen encajar un modelo de la familia Large. Esto es lo que ocurre de verdad entre el micrófono y el texto.
Esta guía la escribió el equipo de LoroNote el 27 de agosto de 2026. LoroNote ejecuta Whisper Large V3 Turbo íntegramente en el dispositivo, así que este artículo describe la maquinaria de la que depende nuestro propio producto. Cada cifra de benchmark enlaza a una fuente primaria — la mayoría recopiladas en nuestra página de estadísticas de transcripción verificadas (en inglés) — y la única medición nuestra está señalada como tal.
Qué significa «en el dispositivo» exactamente
Todos los servicios de transcripción hacen la misma tarea; lo que cambia entre arquitecturas es dónde está el modelo.
| Paso | Transcripción en la nube | Transcripción en el dispositivo |
|---|---|---|
| Grabación | En tu teléfono | En tu teléfono |
| Subida | El audio viaja a los servidores del proveedor | No existe |
| Modelo de voz | Se ejecuta en GPU de servidor | Se ejecuta en los procesadores del teléfono |
| Resultado | El texto vuelve por la red | El texto se escribe localmente |
| Funciona sin conexión | No | Sí — ningún paso necesita red |
| Quién puede acceder al audio | Tú y la infraestructura del proveedor | Solo quien tenga el teléfono |
Las dos últimas filas son las que importan. Funcionar sin conexión no es una función añadida a la transcripción en el dispositivo; es un efecto secundario de la arquitectura — nada en el proceso necesita red. Y la propiedad de privacidad funciona igual: un audio que nunca se subió no puede retenerse, filtrarse ni ser revisado por un proveedor, no porque una política prometa prudencia, sino porque no existe copia alguna que proteger. Es una afirmación sobre arquitectura, no una garantía legal — qué implica eso para tus propias obligaciones lo decides tú, pero el hecho técnico se comprueba en modo Avión.
El proceso: qué pasa entre el micrófono y el texto
Los modelos de voz modernos como Whisper, de OpenAI, procesan el audio en unas pocas etapas concretas, y en una app en el dispositivo todas se ejecutan localmente:
- Remuestreo. El audio se convierte a 16 000 Hz — el artículo de Whisper indica que todo el audio de entrenamiento se remuestrea a esa frecuencia, así que cualquier cosa por encima se descarta antes de que el modelo llegue a escuchar. (Por eso grabar a frecuencias de estudio no mejora la precisión.)
- El espectrograma. La onda se convierte en un espectrograma Mel — según el mismo artículo, una representación logarítmica calculada sobre ventanas de 25 milisegundos con un paso de 10 milisegundos. El modelo nunca oye «sonido»; lee este mapa, parecido a una imagen, de qué frecuencias llevan energía a lo largo del tiempo.
- Codificación. Un codificador Transformer digiere el espectrograma y lo convierte en una representación interna de lo que se dijo acústicamente.
- Decodificación. Un decodificador Transformer escribe la transcripción token a token, apoyándose tanto en la representación del audio como en el texto que lleva producido — por eso Whisper se lee con tanta fluidez, y también por eso puede inventar texto fluido sobre el silencio.
A ninguna de estas etapas le importa dónde se ejecuta. Una GPU de servidor y un teléfono realizan las mismas matemáticas sobre los mismos pesos — y esa es exactamente la razón de que la transcripción en el dispositivo se volviera posible en cuanto los chips de los teléfonos estuvieron a la altura.
El hardware: qué hace el Neural Engine
Hace años que los chips de los teléfonos dejaron de ser solo CPU. Los sistemas en chip de la serie A de Apple llevan un bloque dedicado a las matemáticas de redes neuronales — el Neural Engine — junto a la CPU y la GPU, y el propio anuncio del iPhone 15 Pro describía el Neural Engine del A17 Pro como hasta dos veces más rápido que el de su predecesor. Las apps de transcripción que llegan al mercado convierten sus modelos al formato Core ML de Apple para que este hardware ejecute el codificador y el decodificador con eficiencia.

Ilustración de un chip de la serie A de Apple. Junto a la CPU y la GPU, chips como este llevan un Neural Engine dedicado — el bloque que ejecuta las matemáticas del modelo de voz dentro del dispositivo. Fuente:
Wikimedia Commons (Henriok)
, CC0.
Ahora bien, la restricción práctica no es la velocidad del chip, sino si el modelo cabe en la memoria. La tabla publicada por OpenAI deja claro lo que hay en juego (parámetros y huellas de referencia, medidos en una GPU de servidor):
| Variante de Whisper | Parámetros | Memoria de referencia | Velocidad relativa (A100) |
|---|---|---|---|
| tiny | 39 M | ~1 GB | ~10× |
| base | 74 M | ~1 GB | ~7× |
| small | 244 M | ~2 GB | ~4× |
| medium | 769 M | ~5 GB | ~2× |
| large | 1550 M | ~10 GB | 1× |
| turbo | 809 M | ~6 GB | ~8× |
Dos salvedades honestas sobre esa tabla. Las columnas de memoria y velocidad son cifras de referencia de OpenAI para inferencia en GPU — un teléfono no tiene VRAM aparte, y las apps reales cuantizan los modelos para Core ML, lo que cambia tanto la huella como el rendimiento. Lee la tabla como la relación entre variantes, no como la ficha técnica de un teléfono. Pero esa relación es justo lo que importa: un teléfono aloja un modelo pequeño sin esfuerzo y uno de la familia Large solo con ingeniería seria de por medio — por eso varias apps conocidas de iPhone cargan sin decirlo small o medium aunque sus versiones de escritorio ejecuten large. Whisper Large V3 Turbo — 809 millones de parámetros con el decodificador recortado de 32 capas a 4 — existe precisamente para que la precisión de la familia Large quepa en ese presupuesto; ya explicamos por qué LoroNote lo eligió.
¿Se pierde precisión al transcribir en el dispositivo?
No — y este es el malentendido más persistente al respecto. Los pesos de un modelo son matemáticas deterministas: la misma variante produce transcripciones de la misma calidad en un teléfono que en un servidor. Ejecutar en el dispositivo no es un modo degradado.
Lo que sí cambia entre apps es qué variante cargan, y esa diferencia es grande — las cifras publicadas sitúan a las variantes pequeñas de Whisper en aproximadamente el doble de errores que los motores de la familia Large sobre el mismo benchmark. Así que la pregunta sobre la precisión nunca fue «¿nube o dispositivo?». Es «¿qué modelo?», y hay que hacérsela a cada app por separado. Las cifras medidas, desde voz leída limpia hasta salas de reuniones, están en ¿Cómo de preciso es Whisper?
¿Qué velocidad alcanza en la práctica?
Una de las cifras es nuestra, así que la señalamos: en un iPhone 15 Pro, LoroNote transcribe a unas 19 veces el tiempo real — una grabación de una hora se convierte en texto en unos tres minutos, todo dentro del dispositivo (medición de LoroNote, 13-08-2026). Como referencia de otro motor en el dispositivo, el benchmark del SpeechAnalyzer de iOS 26 de Apple reportó entre 12 y 40 veces el tiempo real en un M2 Pro de escritorio — con salvedades importantes sobre lo que ese benchmark midió y lo que no.
La velocidad en el dispositivo tiene una propiedad que la de la nube no tiene: es tuya. Sin colas, sin límites de uso, sin contador por minuto — transcribir una hora más se paga en batería, no en factura.
Lo que este enfoque de verdad no puede hacer
Una definición honesta incluye los límites:
- El modelo solo mejora cuando la app se actualiza. Un proveedor de nube puede cambiar a un modelo mejor en el servidor de la noche a la mañana; una app en el dispositivo lleva el modelo dentro, así que las mejoras llegan con las actualizaciones de la app, no a escondidas.
- Los lotes grandes siguen favoreciendo al hardware grande. Transcribir cientos de horas para un archivo de investigación es más rápido en una GPU de escritorio o en una cola de nube de pago que en cualquier teléfono.
- Todo lo que es multiusuario por naturaleza necesita un servidor. Una transcripción compartida en vivo que diez personas editan durante una llamada es coordinación, no transcripción — cuándo sigue conviniendo un servicio en la nube repasa esos casos.
- El cálculo sostenido consume batería. La transcripción ocurre una vez por grabación, no de forma continua, pero un archivo largo es trabajo de verdad para el chip — enchufar el teléfono para un lote de tres horas es razonable.
Ninguno de estos límites cambia lo esencial: para grabaciones personales — reuniones, clases, entrevistas, notas — el trabajo ocurre en hardware que ya es tuyo, con la precisión del modelo que elegiste, y sin que nada salga del dispositivo.
Preguntas frecuentes
¿La transcripción en el dispositivo es privada de verdad?
Su privacidad es arquitectónica: el proceso no contiene ningún paso de subida, así que no existe en ninguna parte una copia de tu audio que pueda retenerse o filtrarse. La arquitectura puedes verificarla tú mismo — activa el modo Avión y transcribe. Qué significa ese hecho para tus propias obligaciones de confidencialidad es un juicio que solo te corresponde a ti; la afirmación técnica es, simplemente, que el audio se queda en el teléfono.
¿La transcripción en el dispositivo funciona sin conexión?
Sí, por construcción — nada en el proceso necesita red. El modelo se descarga una vez con la app; a partir de ahí, grabar y transcribir funciona en un sótano, en un avión o en modo Avión.
¿Es menos precisa que la transcripción en la nube?
No por el lugar donde se ejecuta — pesos idénticos producen calidad idéntica en cualquier parte. Las diferencias de precisión entre apps vienen de qué variante del modelo carga cada una, y la presión de memoria del teléfono es la razón de que algunas elijan variantes pequeñas. Comprueba la variante, no el lugar.
¿Por qué algunas apps de iPhone ejecutan modelos de Whisper más pequeños?
Por la memoria. La tabla de referencia de OpenAI va de 39 millones a 1550 millones de parámetros, y las variantes grandes necesitan varios gigabytes incluso antes de contar las restricciones de un teléfono. Encajar un modelo de la familia Large en un teléfono exige ingeniería deliberada — cuantización, conversión a Core ML, una arquitectura optimizada para velocidad como el decodificador de cuatro capas de Turbo — y no todas las apps invierten en ello.
¿El dictado integrado de Apple también es transcripción con IA en el dispositivo?
Cada vez más, sí. El SpeechAnalyzer de iOS 26 de Apple se ejecuta íntegramente en el dispositivo, como una app de Whisper local — las diferencias son la cobertura y los requisitos: el motor de Apple admitía 22 idiomas en agosto de 2026 frente a los cerca de 100 de Whisper, y exige iOS 26. Comparamos los dos motores en detalle.
¿La transcripción en el dispositivo gasta mucha batería?
La transcripción es una ráfaga de cálculo real, no un consumo de fondo — se ejecuta cuando transcribes y se detiene cuando el texto está listo. Con grabaciones cortas es insignificante; para lotes de varias horas, trátala como cualquier tarea pesada y enchufa el teléfono.
Reflexión final sobre la transcripción con IA en el dispositivo
La transcripción con IA en el dispositivo no es una versión recortada de un servicio en la nube; son las mismas matemáticas ejecutadas en un chip que ya es tuyo. La definición que merece recordarse tiene tres partes: el audio no tiene ningún paso de subida por el que viajar (comprobable en modo Avión), la precisión es una propiedad de la variante del modelo y no del lugar donde se ejecuta, y lo que decide qué variante puede llevar una app es la memoria del teléfono — no su velocidad. Juzga cualquier app de este tipo por esa última pregunta, porque es la que el marketing nunca responde.
Fuentes
- OpenAI, repositorio de Whisper — tabla de tamaños de modelo (parámetros, memoria de referencia, velocidades relativas medidas en una GPU A100)
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — remuestreo a 16 000 Hz, espectrograma Mel, arquitectura codificador-decodificador
- Apple, anuncio del iPhone 15 Pro — la afirmación del Neural Engine del A17 Pro «hasta 2 veces más rápido»
- Lyonesse, Apple’s New Speech API vs Whisper — el rango de rendimiento del SpeechAnalyzer y sus salvedades
- LoroNote, AI transcription statistics (en inglés) — cifras de precisión verificadas con fuentes primarias y fechas
Cifras contrastadas con las fuentes enlazadas el 27 de agosto de 2026.
Tu voz se convierte en texto — sin conexión
LoroNote transcribe reuniones, clases y entrevistas directamente en tu iPhone — privado, preciso e ilimitado.
Descargar en el App Store