Qual a precisão da transcrição com IA? O WER explicado (2026)
Entenda a taxa de erro de palavra (WER): como a precisão da transcrição por IA é medida e quais fatores influenciam o resultado final.
"Qual a precisão da transcrição com IA?" é a pergunta certa com uma resposta escorregadia, porque precisão não é um número só — depende do áudio. O mesmo sistema que acerta em cheio uma gravação limpa de estúdio tropeça numa ligação barulhenta de quatro pessoas. Para falar disso com precisão, é preciso a métrica que a área realmente usa: a taxa de erro de palavra (WER, Word Error Rate).
O que significa a taxa de erro de palavra
A taxa de erro de palavra é a proporção de palavras que uma transcrição erra, medida contra uma referência correta. Ela conta três tipos de erro:
- Substituições (S) — uma palavra errada ("mas" por "mais").
- Eliminações (D) — uma palavra que foi dita mas está faltando na transcrição.
- Inserções (I) — uma palavra na transcrição que nunca foi dita.
A fórmula divide esses erros pelo número de palavras da referência (N):
WER = (S + D + I) / N
Um exemplo rápido. A referência é "vamos almoçar ao meio-dia na segunda" (6 palavras). A transcrição diz "vamos almoçar meio-dia na terça": "segunda" → "terça" é uma substituição, e o "ao" perdido é uma eliminação. São 2 erros em 6 palavras — um WER de 0,33, ou 33%. Quanto mais baixo, melhor; um WER de 4% significa cerca de 96% de precisão.
Uma ressalva que o WER esconde: ele trata todos os erros como iguais. Comer um "é" e transformar um "não" em "nada" contam ambos como um erro, ainda que só um mude o sentido. Leia um WER baixo como "quase tudo certo", não como "seguro para publicar sem ler".
Então, quais são os números reais?
Com fala lida e limpa — um único locutor, bom microfone, sem ruído de fundo — os sistemas modernos são realmente fortes. No conhecido benchmark LibriSpeech test-clean, a OpenAI relatou que seus modelos Whisper alcançavam um WER em torno de 3%, com os maiores modelos ainda mais baixos.1 Isso está na mesma faixa de um humano cuidadoso.
O detalhe é que a maioria das gravações reais não é fala lida e limpa. Em áudio mais difícil — sotaques, sobreposição de vozes, ruído de fundo, conversa espontânea — o WER sobe, muitas vezes para a faixa de 5–15% ou pior, dependendo das condições. O número do benchmark é um teto, não o que você obterá de uma gravação de celular numa cafeteria.
Nem os humanos chegam a 100%
É tentador cobrar da IA um padrão "perfeito", mas a transcrição humana também não é perfeita. A transcrição profissional cuidadosa é muitas vezes citada em torno de 4% de WER, e estudos de fala conversacional descobriram que transcritores humanos experientes discordam entre si em cerca de 4–4,5% em áudio difícil — eles ouvem palavras ambíguas de formas diferentes.2 "100% de precisão" não é uma meta real para ninguém; o objetivo honesto é pouco erro mais revisão humana de tudo o que importa.
O que realmente move a precisão
Se você quer uma transcrição melhor, estas são as alavancas, mais ou menos em ordem de impacto:
- Ruído de fundo. O maior fator isolado. Uma sala silenciosa vence qualquer ajuste de software.
- Distância e qualidade do microfone. Um microfone próximo capta fala limpa; o microfone de um notebook do outro lado da mesa capta a sala.
- Fala sobreposta. Pessoas falando por cima umas das outras é difícil para as máquinas (e para os humanos). Microfones separados ou a alternância de turnos ajudam enormemente.
- Sotaques e dialetos. A cobertura varia por idioma e sotaque; sotaques regionais fortes elevam o WER.
- Vocabulário do domínio. Nomes, siglas, nomes de medicamentos, de produtos e jargão são as substituições mais comuns, porque são raros na fala comum.
- Formato e taxa de bits do áudio. Áudio muito comprimido ou de baixa taxa de bits joga fora o detalhe de que o modelo precisa.
Como obter a transcrição mais precisa
- Grave limpo. Microfone próximo, sala silenciosa, uma voz de cada vez. Isso faz mais do que qualquer pós-processamento.
- Use um arquivo sem perdas ou de alta taxa de bits (
wav, ou um bommp3/m4a) em vez de um muito comprimido. - Separe os locutores onde puder — ajuda tanto nas palavras quanto nos rótulos de quem fala. (Mais sobre isso em o que é diarização de locutores.)
- Verifique contra o áudio. Trate a transcrição automática como um primeiro rascunho. No ScribeToAny, clicar num segmento reproduz aquele momento, a forma mais rápida de corrigir um nome ou termo mal ouvido.
- Corrija primeiro o vocabulário. Os erros que importam costumam ser nomes e jargão — corrija-os antes de qualquer coisa.
Conclusão
Para áudio limpo, a transcrição com IA em 2026 está perto do nível humano e devolve um resultado em minutos, não em horas. Para áudio bagunçado, é um primeiro rascunho sólido que ainda precisa de uma passada humana — exatamente onde você gostaria de gastar o tempo de revisão de qualquer forma. O número a observar não é uma alegação de marketing de "99% de precisão"; é como o seu próprio áudio se comporta e o quão fácil a ferramenta torna corrigi-lo.
Experimente no seu próprio arquivo com as ferramentas de áudio para texto, fala para texto ou voz para texto, e julgue a precisão na gravação que você de fato tem.
A precisão é uma propriedade do áudio tanto quanto do software. Grave bem, verifique o que for citar, e uma taxa de erro de palavra baixa se transforma numa transcrição em que você pode confiar. Prefere a seguir uma introdução aos formatos? Veja os formatos de arquivo de legendas e transcrições explicados.
Footnotes
-
Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (OpenAI, 2022) — o Whisper alcança cerca de 3% de WER no LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩
-
Sobre transcrição humana cuidadosa vs. rápida e a discordância entre transcritores (~4–4,5% de WER em fala conversacional), veja p. ex. Stolcke & Droppo, "Comparing Human and Machine Errors in Conversational Speech Transcription" (2017). https://arxiv.org/abs/1708.08615 ↩