Todos os artigos
Guias2026/08/21

Qual a precisão da transcrição com IA? O WER explicado (2026)

Entenda a taxa de erro de palavra (WER): como a precisão da transcrição por IA é medida e quais fatores influenciam o resultado final.

"Qual a precisão da transcrição com IA?" é a pergunta certa com uma resposta escorregadia, porque precisão não é um número só — depende do áudio. O mesmo sistema que acerta em cheio uma gravação limpa de estúdio tropeça numa ligação barulhenta de quatro pessoas. Para falar disso com precisão, é preciso a métrica que a área realmente usa: a taxa de erro de palavra (WER, Word Error Rate).

O que significa a taxa de erro de palavra

A taxa de erro de palavra é a proporção de palavras que uma transcrição erra, medida contra uma referência correta. Ela conta três tipos de erro:

  • Substituições (S) — uma palavra errada ("mas" por "mais").
  • Eliminações (D) — uma palavra que foi dita mas está faltando na transcrição.
  • Inserções (I) — uma palavra na transcrição que nunca foi dita.

A fórmula divide esses erros pelo número de palavras da referência (N):

WER = (S + D + I) / N

Um exemplo rápido. A referência é "vamos almoçar ao meio-dia na segunda" (6 palavras). A transcrição diz "vamos almoçar meio-dia na terça": "segunda" → "terça" é uma substituição, e o "ao" perdido é uma eliminação. São 2 erros em 6 palavras — um WER de 0,33, ou 33%. Quanto mais baixo, melhor; um WER de 4% significa cerca de 96% de precisão.

Uma ressalva que o WER esconde: ele trata todos os erros como iguais. Comer um "é" e transformar um "não" em "nada" contam ambos como um erro, ainda que só um mude o sentido. Leia um WER baixo como "quase tudo certo", não como "seguro para publicar sem ler".

Então, quais são os números reais?

Com fala lida e limpa — um único locutor, bom microfone, sem ruído de fundo — os sistemas modernos são realmente fortes. No conhecido benchmark LibriSpeech test-clean, a OpenAI relatou que seus modelos Whisper alcançavam um WER em torno de 3%, com os maiores modelos ainda mais baixos.1 Isso está na mesma faixa de um humano cuidadoso.

O detalhe é que a maioria das gravações reais não é fala lida e limpa. Em áudio mais difícil — sotaques, sobreposição de vozes, ruído de fundo, conversa espontânea — o WER sobe, muitas vezes para a faixa de 5–15% ou pior, dependendo das condições. O número do benchmark é um teto, não o que você obterá de uma gravação de celular numa cafeteria.

Nem os humanos chegam a 100%

É tentador cobrar da IA um padrão "perfeito", mas a transcrição humana também não é perfeita. A transcrição profissional cuidadosa é muitas vezes citada em torno de 4% de WER, e estudos de fala conversacional descobriram que transcritores humanos experientes discordam entre si em cerca de 4–4,5% em áudio difícil — eles ouvem palavras ambíguas de formas diferentes.2 "100% de precisão" não é uma meta real para ninguém; o objetivo honesto é pouco erro mais revisão humana de tudo o que importa.

O que realmente move a precisão

Se você quer uma transcrição melhor, estas são as alavancas, mais ou menos em ordem de impacto:

  • Ruído de fundo. O maior fator isolado. Uma sala silenciosa vence qualquer ajuste de software.
  • Distância e qualidade do microfone. Um microfone próximo capta fala limpa; o microfone de um notebook do outro lado da mesa capta a sala.
  • Fala sobreposta. Pessoas falando por cima umas das outras é difícil para as máquinas (e para os humanos). Microfones separados ou a alternância de turnos ajudam enormemente.
  • Sotaques e dialetos. A cobertura varia por idioma e sotaque; sotaques regionais fortes elevam o WER.
  • Vocabulário do domínio. Nomes, siglas, nomes de medicamentos, de produtos e jargão são as substituições mais comuns, porque são raros na fala comum.
  • Formato e taxa de bits do áudio. Áudio muito comprimido ou de baixa taxa de bits joga fora o detalhe de que o modelo precisa.

Como obter a transcrição mais precisa

  1. Grave limpo. Microfone próximo, sala silenciosa, uma voz de cada vez. Isso faz mais do que qualquer pós-processamento.
  2. Use um arquivo sem perdas ou de alta taxa de bits (wav, ou um bom mp3/m4a) em vez de um muito comprimido.
  3. Separe os locutores onde puder — ajuda tanto nas palavras quanto nos rótulos de quem fala. (Mais sobre isso em o que é diarização de locutores.)
  4. Verifique contra o áudio. Trate a transcrição automática como um primeiro rascunho. No ScribeToAny, clicar num segmento reproduz aquele momento, a forma mais rápida de corrigir um nome ou termo mal ouvido.
  5. Corrija primeiro o vocabulário. Os erros que importam costumam ser nomes e jargão — corrija-os antes de qualquer coisa.

Conclusão

Para áudio limpo, a transcrição com IA em 2026 está perto do nível humano e devolve um resultado em minutos, não em horas. Para áudio bagunçado, é um primeiro rascunho sólido que ainda precisa de uma passada humana — exatamente onde você gostaria de gastar o tempo de revisão de qualquer forma. O número a observar não é uma alegação de marketing de "99% de precisão"; é como o seu próprio áudio se comporta e o quão fácil a ferramenta torna corrigi-lo.

Experimente no seu próprio arquivo com as ferramentas de áudio para texto, fala para texto ou voz para texto, e julgue a precisão na gravação que você de fato tem.


A precisão é uma propriedade do áudio tanto quanto do software. Grave bem, verifique o que for citar, e uma taxa de erro de palavra baixa se transforma numa transcrição em que você pode confiar. Prefere a seguir uma introdução aos formatos? Veja os formatos de arquivo de legendas e transcrições explicados.

Footnotes

  1. Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (OpenAI, 2022) — o Whisper alcança cerca de 3% de WER no LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩

  2. Sobre transcrição humana cuidadosa vs. rápida e a discordância entre transcritores (~4–4,5% de WER em fala conversacional), veja p. ex. Stolcke & Droppo, "Comparing Human and Machine Errors in Conversational Speech Transcription" (2017). https://arxiv.org/abs/1708.08615 ↩