
Resposta rápida: no benchmark que todo mundo compartilhou, o novo SpeechAnalyzer no dispositivo da Apple realmente superou o Whisper — 2,12% de taxa de erro por palavra contra 3,74% no LibriSpeech test-clean. Só que esse teste rodou o Whisper Small, em audiolivros em inglês, num Mac. Ele nunca testou o Whisper Large V3 nem o Large V3 Turbo, que são os modelos que um app realmente carrega no iPhone, e não encostou em nenhuma reunião, nenhum sotaque e nenhum dos outros ~99 idiomas do Whisper. O motor da Apple é rápido, preciso e gratuito, dentro dos 22 idiomas que ele aceita. O Whisper cobre cerca de cinco vezes mais.
Todos os números abaixo vêm do texto do próprio autor do benchmark, dos artigos e cartões de modelo publicados pela OpenAI, do Open ASR Leaderboard ou da documentação para desenvolvedores da Apple — tudo com link no final. Este texto foi escrito pela equipe do LoroNote em 23 de agosto de 2026. O LoroNote roda o Whisper Large V3 Turbo no dispositivo, ou seja, temos interesse nessa comparação. É exatamente por isso que cada número aqui é a medição de outra pessoa, não a nossa.
O que é o SpeechAnalyzer, na prática
O SpeechAnalyzer é o framework de fala que a Apple apresentou na WWDC 2025 e lançou no iOS 26. Ele substitui o SFSpeechRecognizer, a API envelhecida que sustentou a maior parte do ditado de terceiros no iOS por uma década.
Dois módulos públicos importam:
SpeechTranscribertransforma fala em texto.SpeechDetectoridentifica onde há fala em um fluxo de áudio.
Tudo roda no dispositivo. Os pacotes de idioma são baixados pelo catálogo de recursos do sistema em vez de virem embutidos em cada app, e por isso um app que usa essa API quase não aumenta de tamanho. Para os idiomas que o SpeechTranscriber não cobre, a Apple oferece o DictationTranscriber como alternativa.
Existe um requisito duro que quase toda comparação pula: o SpeechAnalyzer exige iOS 26 ou posterior e não é retrocompatível. Em um iPhone que ainda está no iOS 18, ele simplesmente não existe.
O benchmark que todo mundo citou
Os números que se espalharam pela imprensa de tecnologia em julho de 2026 saíram de uma única avaliação feita por um desenvolvedor. Foi isto que ele mediu:
| Condição | Valor |
|---|---|
| Corpus | LibriSpeech — 5.559 enunciados (2.620 test-clean, 2.939 test-other) |
| Áudio | Fala lida de audiolivro, um único falante, gravação limpa |
| Idioma | apenas inglês |
| Hardware | M2 Pro, 32 GB, macOS 26.5.1, tudo no dispositivo |
| Variantes do Whisper testadas | Tiny, Base, Small |
E os resultados:
| Motor | WER test-clean | WER test-other |
|---|---|---|
| Apple SpeechAnalyzer | 2,12% | 4,56% |
| Whisper Small (~460 MB) | 3,74% | 7,95% |
| Whisper Base (~140 MB) | 5,42% | 12,51% |
| Whisper Tiny (~40 MB) | 7,88% | 17,04% |
| SFSpeechRecognizer (antigo) | 9,02% | 16,25% |
Duas coisas dessa tabela merecem ser ditas sem rodeios. A vantagem da Apple sobre a própria API antiga é enorme — cerca de 75% menos erros, e essa é a notícia de verdade para quem construiu em cima do SFSpeechRecognizer. E a Apple realmente ganhou de todos os modelos Whisper que foram testados.
O problema é quais modelos foram testados.
Três coisas que o benchmark não mediu
1. Os modelos Whisper que os apps realmente rodam
O Whisper Small é um modelo de 460 MB. Não é o que um app de transcrição sério carrega em um iPhone atual. O LoroNote roda o Large V3 Turbo: 809 milhões de parâmetros, com o decodificador reduzido de 32 camadas para 4 em nome da velocidade.
O benchmark parou antes do Medium, do Large e do Turbo. Para dar escala, avaliações publicadas colocam o Whisper Large V3 no LibriSpeech em torno de 2,0–2,5% de WER em test-clean e 3,9–4,3% em test-other — a mesma vizinhança dos 2,12% e 4,56% da Apple, ou um pouco melhor.
Trate essa comparação com cuidado. Esses números do Whisper vêm de avaliações separadas, cada uma com sua própria normalização de texto, e não de um confronto direto na mesma máquina contra o motor da Apple. Só a escolha de normalização já move o WER do LibriSpeech em mais de um ponto — o nosso guia de WER explica como isso acontece. A conclusão honesta não é “o Whisper Large vence”. É que nenhum teste publicado comparou o motor da Apple com os modelos Whisper que realmente estão em questão — e a distância sugerida pelas manchetes é um efeito do tamanho de modelo escolhido.
2. Qualquer coisa mais difícil que um audiolivro de estúdio
O LibriSpeech é fala lida: uma pessoa, um livro, um bom microfone, ninguém falando por cima. É o degrau mais baixo da escada, e é justamente ali que todo motor registra seu melhor número.
Gravações reais ficam mais acima. Na escada de precisão que documentamos para o Whisper, esse mesmo Large V3 que faz 2–3% em fala lida limpa tem média de cerca de 7,4% numa mistura de benchmarks reais em inglês e fica perto de 16% em áudio de sala de reunião AMI, com microfones distantes e vozes se sobrepondo.
Ninguém publicou esses degraus para o SpeechAnalyzer. Enquanto isso não acontecer, um resultado de 2,12% em audiolivro diz muito pouco sobre uma reunião de quatro pessoas gravada do meio da mesa. O autor do benchmark foi direto nesse ponto: o texto descreve o corpus como “fala lida de audiolivro, não reuniões”.
3. Outros noventa e nove idiomas
Essa é a maior lacuna, e o autor apontou isso explicitamente: os números “não dizem nada sobre os mais de 100 idiomas que o Whisper aceita”.
Em agosto de 2026, o SpeechTranscriber.supportedLocales retorna 42 variantes regionais cobrindo 22 idiomas:
alemão, árabe, cantonês, chinês (simplificado, tradicional, Hong Kong), coreano, dinamarquês, espanhol, finlandês, francês, hebraico, holandês, inglês (nove variantes regionais), italiano, japonês, malaio, norueguês (bokmål), português, russo, sueco, tailandês, turco e vietnamita.
O Whisper Large V3 cobre cerca de 100. As ausências na lista da Apple não são casos marginais: não há hindi, polonês, tcheco, grego, ucraniano nem indonésio.
Para quem lê em português, há um detalhe específico. O português aparece apenas como pt_BR. Não existe variante de Portugal na lista: quem fala português europeu cai no DictationTranscriber ou no pt_BR, com um modelo treinado em outra variante. Já para o português do Brasil, o suporte existe — o problema é outro: não há números de precisão publicados em português para nenhum dos dois motores. O benchmark que viralizou mediu só inglês, e a Apple não divulga WER por idioma. Então afirmar hoje que a Apple transcreve português melhor que o Whisper, ou o contrário, é falar sem base. Dois minutos da sua própria gravação continuam sendo a fonte mais confiável.
A Apple disse que vai acrescentar mais idiomas, então essa lista vai ficar desatualizada em algum momento. Mas “aceita” e “igualmente preciso” continuam sendo afirmações diferentes nos dois motores. Por isso vale confrontar a lista completa de idiomas com o seu próprio áudio em vez de confiar numa contagem.
Sobre o “três vezes mais rápido”
A afirmação de velocidade viajou tão longe quanto a de precisão, e tem a mesma nota de rodapé: foi medida contra o Whisper Small.
O que o benchmark relatou foi uma faixa de desempenho de aproximadamente 12 a 40 vezes o tempo real em um M2 Pro — uma hora de áudio em cerca de 1,5 a 5 minutos. O autor segurou de propósito os tempos exatos por modelo até refazer as medições com a máquina ociosa.
Essa faixa é real e o motor da Apple é rápido. Mas ela veio de um chip M de mesa com 32 GB de RAM, não de um celular. No iPhone, a restrição que manda em qualquer modelo de transcrição é a memória, não o poder bruto de processamento. É também por isso que vários “apps de Whisper” conhecidos carregam discretamente small ou medium no celular enquanto suas versões para Mac rodam o large. Nós levantamos qual variante cada app de iOS realmente carrega.
Quando cada um é a melhor escolha
Nenhum dos dois vence de forma geral. Eles foram feitos para trabalhos diferentes.
Escolha o Apple SpeechAnalyzer quando:
- seu idioma estiver entre os 22 aceitos, especialmente se for inglês;
- seu dispositivo estiver no iOS 26 ou posterior;
- você quiser transcrição ao vivo, com resultados parciais se atualizando enquanto a pessoa fala — a API foi desenhada para isso;
- você não quiser download de modelo nem custo.
Escolha a família Whisper Large V3 quando:
- seu idioma estiver fora da lista da Apple, ou suas gravações misturarem idiomas no mesmo arquivo;
- você precisar do mesmo comportamento em aparelhos antigos: apps baseados em Whisper rodam bem abaixo do iOS 26;
- você estiver transcrevendo arquivos já gravados em vez de fala ao vivo, onde precisão pesa mais que latência;
- você quiser que a transcrição saia igual independentemente da versão do sistema.
Não existe almoço grátis em nenhuma direção. O motor da Apple é mais rápido de integrar, não custa nada e é excelente dentro do alcance dele. O alcance do Whisper é cerca de cinco vezes maior, e as variantes Large pagam por essa largura em tamanho de modelo e tempo de processamento.
O que muda na hora de escolher um app de iPhone
Duas consequências práticas.
Primeiro: “transcrição com IA” na App Store já significa pelo menos três coisas diferentes. Um app que chama o SpeechAnalyzer da Apple no dispositivo, um app que roda o próprio modelo Whisper localmente, ou um app que envia seu áudio para um servidor. Privacidade, funcionamento offline e cobertura de idiomas são completamente diferentes, e as descrições raramente esclarecem qual é o caso. Nossa comparação de apps de voz para texto no iOS organiza tudo por onde o áudio é processado.
Segundo: um app ser “no dispositivo” não diz mais nada sobre precisão. Os dois caminhos são locais. A pergunta mudou de para onde vai meu áudio para qual modelo, de qual tamanho, em qual idioma.
Teste você mesmo em cinco minutos
Benchmarks são médias sobre corpora que você nunca vai gravar. Seu próprio áudio é o único teste que responde à sua pergunta:
- Grave dois minutos na sala onde você costuma gravar: seu microfone, seu sotaque, alguns nomes próprios, números e termos técnicos.
- Transcreva com a transcrição nativa do iPhone (Gravador em um aparelho compatível, ou qualquer app que use o motor da Apple).
- Transcreva o mesmo arquivo com um app baseado em Whisper.
- Conte os erros em um trecho de 200 palavras: cada palavra trocada, faltando ou inventada. Erros ÷ 200 = o seu WER. (O método completo, incluindo como decidir o que conta como erro, está no nosso guia de WER.)
Se os dois saírem limpos, use o mais conveniente. A diferença costuma aparecer em nomes próprios, fala sobreposta e qualquer idioma fora do grupo mais bem servido — exatamente onde o benchmark parou de olhar.
Perguntas frequentes
O Apple SpeechAnalyzer é mais preciso que o Whisper?
Contra o Whisper Small em audiolivros limpos em inglês, sim: 2,12% contra 3,74% de WER. Contra o Whisper Large V3 ou o Large V3 Turbo, ninguém publicou um teste direto. Avaliações separadas colocam o Large V3 no mesmo nível ou um pouco à frente no mesmo corpus, mas as normalizações diferentes fazem disso uma comparação aproximada, não um veredito.
Qual é mais preciso em português?
Não há números publicados. O benchmark mais citado mediu só inglês, e a Apple não divulga WER por idioma. Vale notar que a lista da Apple traz apenas pt_BR, sem variante europeia. Para precisão, testar com dois minutos de gravação própria é hoje o único método confiável.
O SpeechAnalyzer funciona offline?
Funciona. Ele roda inteiramente no dispositivo, com os pacotes de idioma baixados uma vez pelo catálogo do sistema. Nesse aspecto ele se iguala a um app de Whisper local: nenhum dos dois manda seu áudio para um servidor.
Preciso do iOS 26?
Precisa. O SpeechAnalyzer exige iOS 26 ou posterior e não é retrocompatível. Apps baseados em Whisper funcionam em versões bem mais antigas, e essa é uma das razões práticas para manter os dois motores no radar.
Algum deles identifica quem está falando?
A identificação de falantes é uma etapa separada da transcrição, e nenhum dos dois motores faz isso como parte do reconhecimento de fala. São os apps que acrescentam esse recurso por cima — como funciona a separação de falantes explica o que está envolvido e onde a coisa quebra.
Por que o LoroNote usa Whisper em vez do motor da Apple?
Por cobertura de idiomas e de aparelhos. O LoroNote transcreve cerca de 100 idiomas, incluindo gravações com idiomas misturados, em aparelhos bem anteriores ao iOS 26. O motor da Apple é excelente dentro dos seus 22 idiomas, mas não substitui essa largura. Explicamos a escolha específica do modelo no nosso guia do Whisper Large V3 Turbo.
Fontes
- Apple, Bring advanced speech-to-text to your app with SpeechAnalyzer — sessão da WWDC25 que apresenta o framework
- Apple, documentação do SpeechTranscriber
- Lyonesse, Apple’s New Speech API vs Whisper: The First Real Benchmark — a avaliação no LibriSpeech, sua metodologia e as limitações declaradas
- OpenAI, Robust Speech Recognition via Large-Scale Weak Supervision — o artigo do Whisper
- OpenAI, cartão do modelo whisper-large-v3 e cartão do modelo whisper-large-v3-turbo
- Open ASR Leaderboard — números de benchmarks mistos e de áudio de reunião AMI
Números do benchmark verificados em 23 de agosto de 2026. A lista de idiomas aceitos pela Apple muda a cada atualização do sistema; confira o SpeechTranscriber.supportedLocales em uma versão atual antes de contar com ela.
Sua voz vira texto — offline
O LoroNote transcreve reuniões, aulas e entrevistas direto no seu iPhone — privado, preciso e ilimitado.
Baixar na App Store