IA

Qual é a precisão do Whisper? Números reais, do audiolivro à sala de reunião (2026)

Equipe LoroNote11 min

A precisão real do Whisper: 2–3% de erro em fala lida limpa, cerca de 7% em benchmarks mistos em inglês e uns 16% em salas de reunião — e o que move esses números.

Resposta rápida: não existe um único número de precisão para o Whisper — existe uma escada. Em fala lida limpa, com um só falante, os modelos large chegam a cerca de 2–3% de taxa de erro por palavra (WER), ou seja, mais de 97 palavras certas em cada 100. Em uma mistura de benchmarks reais em inglês, o Whisper Large V3 tem média de uns 7,4% de WER. Em áudio de sala de reunião, com microfones distantes e falantes sobrepostos, o mesmo modelo fica em torno de 16%. E em idiomas com poucos recursos a taxa de erro pode triplicar de novo. Se o Whisper é “preciso” depende de em qual degrau a sua gravação está — e, na mesma medida, de qual variante do Whisper o app que você usa realmente executa.

Todo número deste artigo vem do artigo científico e das fichas de modelo publicados pela OpenAI ou do Open ASR Leaderboard público, com links nas fontes ao final. Ele foi escrito pela equipe do LoroNote em 19 de agosto de 2026. O LoroNote roda o Whisper Large V3 Turbo no aparelho, então temos interesse aqui — e é exatamente por isso que nada abaixo é número de marketing nosso.

O que a taxa de erro por palavra realmente mede

O WER conta as palavras que a transcrição errou — substituídas, omitidas ou inventadas — como proporção das palavras faladas. Um WER de 5% significa um erro a cada 20 palavras; 16%, um a cada seis. Da definição seguem duas coisas:

  1. Um WER só significa algo ao lado do áudio em que foi medido. “98% de precisão” sem um conjunto de teste nomeado é slogan, não medição. O mesmo modelo produz mais de 97% em um audiolivro e 84% em uma sala de conferência sem que nada esteja errado.
  2. Nem todo erro custa igual. Um “é…” descartado e o nome errado de um remédio contam uma vez cada. O WER é a régua padrão porque é objetivo, não porque capture o quanto uma transcrição é utilizável — e é por isso que testar com o seu próprio áudio, como mostramos abaixo, vale mais do que qualquer tabela.

Destrinchamos a definição completa — a fórmula, por que o WER pode passar de 100% e a etapa de normalização que move em silêncio os números publicados — em O que é taxa de erro de palavras?

A escada da precisão: um modelo, quatro degraus

Estes são números publicados dos modelos large do Whisper em benchmarks padrão:

Condições do áudioBenchmarkWER aproximadoFonte
Fala lida limpa, um falanteLibriSpeech test-clean~2–3%Artigo do Whisper da OpenAI (2,7%, large)
Áudio real misto em inglês, oito conjuntosMédia do Open ASR Leaderboard~7,4% (Large V3)Open ASR Leaderboard
Salas de reunião, microfones longe, cross-talkCorpus de reuniões AMI~16% (Large V3)Open ASR Leaderboard
Exemplo de idioma com poucos recursosHíndi (Common Voice)~27% (Large V3)Ficha do modelo openai/whisper-large-v3

Leia a escada de cima para baixo e o padrão fica claro: o modelo não piora — o áudio piora. Ditar com o telefone perto da boca fica perto do degrau de cima. Uma entrevista atravessando a mesa de um café fica no meio. Uma reunião gravada da outra ponta da mesa cai no terceiro degrau, antes de qualquer decisão de software.

Qual Whisper? A variante muda a resposta

“Com tecnologia Whisper” descreve uma família, não um modelo. O Whisper vem em tamanhos do tiny ao large, e a distância entre eles é maior do que a distância entre fornecedores:

  • O Large V3 é o carro-chefe em precisão. A OpenAI o treinou com 1 milhão de horas de áudio com rótulos fracos mais 4 milhões de horas de áudio pseudorrotulado, e informa 10–20% menos erros que o Large V2 em uma ampla gama de idiomas.
  • O Large V3 Turbo é o derivado otimizado para velocidade: 809 milhões de parâmetros, com o decodificador cortado de 32 camadas para 4. A OpenAI descreve o custo como uma “degradação menor de qualidade” — no Open ASR Leaderboard as médias ficam próximas (cerca de 7,8% contra 7,4% de WER médio; cerca de 16,1% contra 16,0% no AMI). Combinado entre idiomas, ele rende de forma parecida com o Large V2, e perde mais em alguns poucos idiomas, como tailandês e cantonês. Destrinchamos essa troca no nosso guia do Whisper Large V3 Turbo.
  • O small e o medium ficam vários pontos acima em WER — uma diferença real, visível em um teste de um parágrafo. Isso importa especialmente no iPhone, porque vários “apps Whisper” conhecidos rodam o small ou o medium no telefone mesmo quando suas versões de Mac rodam o large. Nosso comparativo de apps Whisper lista qual variante cada app de iOS realmente carrega.

A regra prática: antes de comparar apps por precisão, confira qual Whisper cada um executa. Um app rodando o Large V3 Turbo e um app rodando o small não oferecem a mesma precisão, digam o que disserem as duas fichas sobre “IA Whisper”.

O idioma move o número mais do que qualquer outra coisa no software

Os dados de treinamento do Whisper pendem fortemente para os idiomas com muitos recursos, e a precisão acompanha. Inglês, espanhol, alemão, japonês, coreano e outros idiomas bem representados se agrupam perto das médias acima. Idiomas com poucos recursos ficam bem mais alto — o número do híndi na tabela é um exemplo publicado, e a ficha do modelo da OpenAI aponta ainda desempenho desigual entre sotaques e dialetos dentro de um mesmo idioma.

O Whisper Large V3 cobre cerca de 100 idiomas (o cantonês foi adicionado no V3), então “suportado” e “igualmente preciso” são afirmações diferentes. Se o seu idioma está fora do grupo com muitos recursos, o conselho honesto é o mesmo do artigo inteiro: rode uma gravação curta sua e olhe o resultado — a lista completa de idiomas diz o que o LoroNote vai tentar, e dois minutos do seu próprio áudio dizem com que qualidade.

Alucinações: o erro que o WER subestima

A ficha do modelo da OpenAI diz sem rodeios: como os modelos são treinados com dados ruidosos em grande escala, “as previsões podem incluir textos que não foram de fato falados no áudio de entrada (ou seja, alucinação)”. Na prática, isso aparece com silêncio, ruído de fundo e música — o Whisper é um modelo generativo e, quando não há fala para ancorá-lo, pode produzir frases fluentes que ninguém disse.

Duas coisas mantêm isso administrável:

  • Os apps podem mitigar isso. Uma detecção de atividade de voz que pula os trechos silenciosos remove a principal oportunidade de o modelo inventar texto. É um comportamento do app, não um ajuste do modelo, e é uma das diferenças reais entre apps que rodam o mesmo Whisper.
  • Dá para perceber. Texto alucinado tende a aparecer em trechos que você sabe que ficaram quietos — o fim de uma gravação, uma pausa longa. Se o meio da transcrição está sólido, mas nos silêncios dela cresceram frases, você está vendo alucinação, não erro de audição.

Comparamos esse comportamento com um modelo de arquitetura transdutora em Parakeet V3 vs Whisper Large V3 — transdutores alucinam menos no silêncio, enquanto o Whisper cobre muito mais idiomas; não existe almoço grátis.

O que realmente move a precisão nas suas gravações

Os benchmarks variam o áudio; as suas gravações variam as mesmas coisas. Em ordem aproximada de impacto:

  1. Distância do microfone. A maior alavanca. Um telefone ao alcance da mão sobre a mesa vence um telefone do outro lado da sala por mais do que qualquer upgrade de modelo.
  2. Ruído e música. Ruído de fundo constante degrada o resultado aos poucos; música e barulho de louça derrubam a qualidade de vez.
  3. Falantes sobrepostos. O cross-talk é o motivo de os corpora de reunião ficarem em ~16% enquanto o áudio de um só falante fica em ~3%.
  4. Vocabulário especializado. Nomes próprios, remédios, tickers e jargão falham desproporcionalmente. O dicionário personalizado do LoroNote existe exatamente para isso: termos recorrentes que ele deve parar de errar.
  5. A variante do modelo — o único fator da lista que é escolha puramente de software, e o motivo de o LoroNote rodar a maior variante do Whisper que é prática em um telefone.

As etiquetas de falante merecem uma nota: a diarização não muda o WER, mas muda se uma transcrição com vários falantes é utilizável ou não. Uma transcrição precisa sem falantes ainda é lição de casa; como funciona a identificação de falantes cobre essa metade do problema.

Como medir você mesmo a precisão do Whisper em dez minutos

Um teste com o seu próprio áudio vale mais que todas as tabelas deste artigo:

  1. Grave uns dois minutos parecidos com o seu uso real — mesma sala, mesma distância, mesmo idioma, nomes e jargões de verdade.
  2. Transcreva e leia o resultado contra o áudio.
  3. Conte os erros em um trecho de 200 palavras: cada palavra substituída, ausente ou inventada. Erros ÷ 200 = o seu WER. (Dois minutos de fala passam com folga das 200 palavras.)
  4. Julgue os erros, não só a contagem: cinco cacoetes de fala errados e cinco nomes de clientes errados são o mesmo WER — e dias de trabalho bem diferentes.

A versão precisa deste método — incluindo como decidir de antemão o que conta como erro — está no nosso guia de WER.

Como o LoroNote funciona no aparelho e a versão gratuita transcreve os primeiros 2 minutos de qualquer gravação — exatamente o que este teste pede —, o teste não custa nada e a gravação nunca sai do seu iPhone: não há etapa de envio, não há conta, e o modo Avião não muda nada.

Perguntas frequentes

O Whisper é preciso o bastante para transcrições profissionais?

Para gravações limpas, com microfone perto e em idiomas com muitos recursos, os modelos large do Whisper produzem rascunhos que a maioria só edita de leve — os 2–3% de WER em fala limpa estão perto do teto prático dos sistemas automáticos. Para reuniões com microfone distante, muito cross-talk ou literalidade crítica, conte com tempo de revisão: a 16% de WER, uma palavra em cada seis precisa da sua atenção.

O Whisper Large V3 Turbo perde precisão em relação ao Large V3?

Um pouco. A OpenAI chama a degradação de menor, e as médias públicas do leaderboard ficam bem abaixo de um ponto de distância em inglês. Combinado entre idiomas, o Turbo rende de forma parecida com o Large V2, com as maiores perdas em alguns poucos idiomas, como tailandês e cantonês. Em troca, ele é dramaticamente mais rápido — a troca que torna um modelo da série Large prático em um telefone.

Por que a minha transcrição tem frases que ninguém disse?

Isso é alucinação, um comportamento documentado do Whisper diante de silêncio, ruído e música: um modelo generativo sem fala para ancorá-lo pode produzir texto fluente mesmo assim. Confira os trechos quietos da sua gravação. Apps que rodam detecção de atividade de voz antes do Whisper evitam isso em grande parte — é comportamento do app, não ajuste do usuário.

Rodar o Whisper no aparelho reduz a precisão?

Não. Os mesmos pesos do modelo produzem a mesma qualidade de transcrição onde quer que rodem; a inferência no aparelho não é um modo degradado. O que difere entre apps é qual variante cada um roda — serviços na nuvem hospedam os maiores modelos com facilidade, enquanto apps no aparelho precisam caber no telefone, e por isso alguns rodam o small ou o medium. O LoroNote roda o Large V3 Turbo localmente, mantendo um modelo da série Large e a privacidade no aparelho no mesmo app.

Conclusão

“Qual é a precisão do Whisper?” tem uma forma como resposta, não um número: cerca de 2–3% de WER em fala lida limpa, uns 7% em benchmarks mistos em inglês, em torno de 16% em áudio de reunião, e pior em idiomas com poucos recursos — com a alucinação como a letra miúda que o WER subestima. As duas escolhas que mais movem os seus resultados são uma física (aproxime o microfone) e uma estrutural (saber qual variante do Whisper o seu app roda). O resto se mede em dez minutos com a sua própria gravação, que é o único benchmark que fala de fato do seu caso.

Recursos oficiais

Sua voz vira texto — offline

O LoroNote transcreve reuniões, aulas e entrevistas direto no seu iPhone — privado, preciso e ilimitado.

Baixar na App Store