
Índice
- O que “no dispositivo” quer dizer na prática
- O pipeline: o que acontece entre o microfone e o texto
- O hardware: o que o Neural Engine faz
- Transcrever no dispositivo reduz a precisão?
- E a velocidade, na prática?
- O que o processamento local realmente não consegue fazer
- Perguntas frequentes
- Considerações finais sobre a transcrição com IA no dispositivo
- Fontes
Resposta rápida: transcrição com IA no dispositivo significa que o modelo de reconhecimento de fala roda nos processadores do próprio celular — a gravação vira texto sem ser enviada a lugar nenhum. A privacidade aqui é uma questão de arquitetura, não de contrato: não existe etapa de upload por onde o áudio possa passar, e você mesmo confere isso transcrevendo com o modo Avião ligado. Rodar no dispositivo também não significa perder precisão — os mesmos pesos de modelo produzem a mesma transcrição onde quer que rodem. O que existe é um teto de hardware: a memória do celular, e não a capacidade de cálculo, decide qual tamanho de modelo um app consegue carregar — e é por isso que alguns apps rodam as variantes pequenas do Whisper sem avisar, enquanto outros fazem caber um modelo da família Large. Eis o que acontece, de fato, entre o microfone e o texto.
Este guia foi escrito pela equipe do LoroNote em 27 de agosto de 2026. O LoroNote roda o Whisper Large V3 Turbo inteiramente no dispositivo, então este artigo descreve o mecanismo que sustenta o nosso próprio produto. Todo número de benchmark aponta para uma fonte primária — a maioria reunida na nossa página de estatísticas de transcrição verificadas (em inglês); a única medição que é nossa está identificada como tal.
O que “no dispositivo” quer dizer na prática
Todo serviço de transcrição faz a mesma tarefa; o que muda de uma arquitetura para a outra é onde o modelo fica.
| Etapa | Transcrição na nuvem | Transcrição no dispositivo |
|---|---|---|
| Gravação | No seu celular | No seu celular |
| Upload | O áudio viaja para os servidores do serviço | Não existe |
| Modelo de fala | Roda em GPUs de servidor | Roda nos processadores do celular |
| Resultado | O texto volta pela rede | O texto é gerado localmente |
| Funciona offline | Não | Sim — nenhuma etapa precisa de conexão |
| Quem pode acessar o áudio | Você + a infraestrutura do serviço | Só quem está com o celular |
As duas últimas linhas são as que importam. Funcionar offline não é um recurso acrescentado à transcrição no dispositivo; é consequência da arquitetura — nada no pipeline precisa de rede. E a privacidade nasce do mesmo princípio: um áudio que nunca foi enviado não pode ser retido, vazado nem revisado por um provedor — não porque uma política de privacidade prometa isso, mas porque a cópia simplesmente não existe. Isso é uma descrição de arquitetura, não uma garantia jurídica — o que esse fato significa para as suas próprias obrigações é uma avaliação que só você pode fazer; o fato técnico, esse se confere no modo Avião.
O pipeline: o que acontece entre o microfone e o texto
Modelos de fala modernos como o Whisper, da OpenAI, processam o áudio em algumas etapas concretas — e, num app que roda no dispositivo, todas elas acontecem localmente:
- Reamostragem. O áudio é convertido para 16.000 Hz — o artigo do Whisper afirma que todo o áudio de treinamento é reamostrado para essa taxa, então qualquer coisa acima disso é descartada antes de o modelo sequer escutar. (É também por isso que gravar em taxas de estúdio não melhora a precisão.)
- O espectrograma. A forma de onda vira um espectrograma Mel — segundo o artigo, uma representação em escala logarítmica calculada em janelas de 25 milissegundos, avançando de 10 em 10 milissegundos. O modelo nunca ouve “som”; ele lê esse mapa, parecido com uma imagem, de quais frequências carregam energia ao longo do tempo.
- Codificação. Um codificador Transformer digere o espectrograma e o transforma numa representação interna do que foi dito acusticamente.
- Decodificação. Um decodificador Transformer escreve a transcrição token a token, olhando ao mesmo tempo para a representação do áudio e para o texto que já produziu — o que explica por que o Whisper escreve com fluência, e também por que ele consegue inventar texto fluente em cima do silêncio.
Nenhuma dessas etapas depende do lugar onde roda. Uma GPU de servidor e um celular executam a mesma matemática sobre os mesmos pesos — e foi exatamente por isso que a transcrição no dispositivo se tornou possível assim que os chips de celular ficaram à altura.
O hardware: o que o Neural Engine faz
Faz anos que o chip de celular deixou de ser só CPU. Os chips da série A da Apple trazem, ao lado da CPU e da GPU, um bloco dedicado a cálculos de rede neural — o Neural Engine — e o próprio anúncio do iPhone 15 Pro descreveu o Neural Engine do A17 Pro como até duas vezes mais rápido que o antecessor. Os apps de transcrição que chegam ao mercado convertem seus modelos para o formato Core ML, da Apple, para que esse hardware execute o codificador e o decodificador com eficiência.

Ilustração de um chip da série A da Apple. Ao lado da CPU e da GPU, chips como este carregam um Neural Engine dedicado — o bloco que executa a matemática do modelo de fala dentro do aparelho. Fonte:
Wikimedia Commons (Henriok)
, CC0.
A limitação prática, porém, não é a velocidade do chip — é o tamanho de modelo que cabe na memória. A tabela publicada pela OpenAI mostra o tamanho da questão (parâmetros e consumo de referência, medidos numa GPU de servidor):
| Variante do Whisper | Parâmetros | Memória de referência | Velocidade relativa (A100) |
|---|---|---|---|
| tiny | 39M | ~1 GB | ~10× |
| base | 74M | ~1 GB | ~7× |
| small | 244M | ~2 GB | ~4× |
| medium | 769M | ~5 GB | ~2× |
| large | 1.550M | ~10 GB | 1× |
| turbo | 809M | ~6 GB | ~8× |
Duas ressalvas honestas sobre essa tabela. As colunas de memória e velocidade são números de referência da OpenAI para inferência em GPU — um celular não tem um bloco separado de VRAM, e os apps reais quantizam os modelos para o Core ML, o que muda tanto o consumo quanto o desempenho. Leia a tabela como a relação entre as variantes, não como ficha técnica de nenhum app. Mas a relação é justamente o ponto: um modelo pequeno cabe num celular com facilidade, e um da família Large só entra com bastante engenharia — motivo pelo qual vários apps conhecidos de iPhone carregam o small ou o medium sem avisar, mesmo quando suas versões de desktop rodam o large. O Whisper Large V3 Turbo — 809 milhões de parâmetros, com o decodificador reduzido de 32 para 4 camadas — existe exatamente para fazer a precisão da família Large caber nesse orçamento; explicamos por que o LoroNote o escolheu.
Transcrever no dispositivo reduz a precisão?
Não — e esse é o mal-entendido mais persistente sobre o assunto. Pesos de modelo são matemática determinística: a mesma variante produz a mesma qualidade de transcrição num celular ou num servidor. Rodar no dispositivo não é uma versão inferior do serviço.
O que varia de um app para outro é qual variante ele carrega — e essa diferença é grande: pelos números publicados, as variantes pequenas do Whisper registram cerca do dobro da taxa de erro dos motores da família Large no mesmo benchmark. Ou seja: a pergunta sobre precisão nunca foi “nuvem ou dispositivo?”. É “qual modelo?”, feita a cada app individualmente. Os números medidos, da fala lida limpa à sala de reunião, estão em Quão preciso é o Whisper?
E a velocidade, na prática?
Um número aqui é nosso, então o identificamos: num iPhone 15 Pro, o LoroNote transcreve a cerca de 19× o tempo real — uma gravação de uma hora vira texto em uns três minutos, inteiramente no aparelho (medição do LoroNote, 13 de agosto de 2026). Como referência de outro motor local, o benchmark do SpeechAnalyzer do iOS 26, da Apple, relatou de 12× a 40× o tempo real num Mac de mesa com chip M2 Pro — com ressalvas importantes sobre o que esse benchmark testou e o que deixou de fora.
A velocidade no dispositivo tem uma propriedade que a velocidade na nuvem não tem: ela é sua. Sem fila, sem limite de uso, sem tarifa por minuto — o custo marginal de transcrever mais uma hora é bateria, não boleto.
O que o processamento local realmente não consegue fazer
Uma definição honesta inclui os limites:
- O modelo só melhora quando o app é atualizado. Um serviço de nuvem pode trocar o modelo no servidor da noite para o dia; um app local embarca o modelo dentro do próprio app, então as melhorias chegam junto com as atualizações — nunca sem você perceber.
- Trabalhos em lote grandes ainda pedem hardware grande. Transcrever centenas de horas para um acervo de pesquisa sai mais rápido numa GPU de desktop ou numa fila paga de nuvem do que em qualquer celular.
- O que é multiusuário por natureza precisa de servidor. Uma transcrição ao vivo que dez pessoas acompanham e editam durante uma chamada é um problema de coordenação, não de transcrição — quando um serviço de nuvem ainda é a escolha certa trata desses casos.
- Cálculo prolongado gasta bateria. A transcrição acontece uma vez por gravação, não continuamente, mas um arquivo longo é trabalho de verdade para o chip — num lote de três horas, vale deixar o celular na tomada.
Nenhum desses limites muda o essencial: para gravações pessoais — reuniões, aulas, entrevistas, ideias — o trabalho acontece num hardware que você já tem, com a precisão do modelo que você escolheu, sem nada sair do aparelho.
Perguntas frequentes
A transcrição no dispositivo é privada de verdade?
A privacidade dela é arquitetural: o pipeline não tem etapa de upload, então não existe, em lugar nenhum, uma cópia do seu áudio que possa ser retida ou vazada. A arquitetura você mesmo verifica — ligue o modo Avião e transcreva. O que esse fato significa para as suas obrigações de confidencialidade é um julgamento que só você pode fazer; a afirmação técnica é simplesmente que o áudio não sai do celular.
A transcrição no dispositivo funciona offline?
Sim, por construção — nada no pipeline precisa de rede. O modelo é baixado uma vez, junto com o app; depois disso, gravação e transcrição funcionam num porão, num avião ou com o modo Avião ligado.
Transcrever no dispositivo é menos preciso do que na nuvem?
Não por causa do lugar onde roda — pesos idênticos produzem qualidade idêntica em qualquer lugar. As diferenças de precisão entre apps vêm da variante de modelo que cada um carrega, e a pressão da memória do celular é o que leva alguns apps às variantes pequenas. Confira a variante, não o endereço.
Por que alguns apps de iPhone rodam modelos menores do Whisper?
Memória. A tabela de referência da OpenAI vai de 39 milhões a 1,55 bilhão de parâmetros, e as variantes maiores pedem vários gigabytes antes mesmo de considerar as restrições de um celular. Fazer um modelo da família Large caber num celular exige engenharia deliberada — quantização, conversão para Core ML, uma arquitetura otimizada para velocidade como o decodificador de 4 camadas do Turbo — e nem todo app investe nisso.
O ditado nativo da Apple também é transcrição com IA no dispositivo?
Cada vez mais, sim. O SpeechAnalyzer do iOS 26, da Apple, roda inteiramente no aparelho, como um app de Whisper local — as diferenças são cobertura e acesso: o motor da Apple suportava 22 idiomas em agosto de 2026, contra cerca de 100 do Whisper, e exige o iOS 26. Comparamos os dois motores em detalhe.
A transcrição no dispositivo acaba com a bateria?
Transcrever é um pico de processamento, não um consumo contínuo em segundo plano — roda quando você transcreve e para quando o texto fica pronto. Gravações curtas são imperceptíveis; para lotes de várias horas, trate como qualquer tarefa pesada e deixe o celular carregando.
Considerações finais sobre a transcrição com IA no dispositivo
A transcrição com IA no dispositivo não é uma cópia menor de um serviço de nuvem; é a mesma matemática executada num chip que já é seu. A definição que vale guardar tem três partes: o áudio não tem etapa de upload por onde passar (dá para conferir no modo Avião), a precisão depende da variante do modelo e não do lugar onde ela roda, e é a memória do celular — não a velocidade — que decide qual variante um app consegue embarcar. Julgue qualquer app local por essa última pergunta, porque é a única que o marketing nunca responde.
Fontes
- OpenAI, repositório do Whisper — tabela de tamanhos de modelo (parâmetros, memória de referência, velocidades relativas medidas numa GPU A100)
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — reamostragem a 16.000 Hz, espectrograma Mel, arquitetura codificador-decodificador
- Apple, anúncio do iPhone 15 Pro — a afirmação de Neural Engine “até 2x mais rápido” do A17 Pro
- Lyonesse, Apple’s New Speech API vs Whisper — a faixa de velocidade do SpeechAnalyzer e suas ressalvas
- LoroNote, Estatísticas de transcrição por IA — números de precisão verificados, com fontes primárias e datas (em inglês)
Números conferidos de novo nas fontes com link em 27 de agosto de 2026.
Sua voz vira texto — offline
O LoroNote transcreve reuniões, aulas e entrevistas direto no seu iPhone — privado, preciso e ilimitado.
Baixar na App Store