Todos os artigos
Guias2026/08/21

O que é diarização de locutores? Como a IA descobre quem disse o quê

O que é diarização de locutores? Descubra como a IA separa as vozes em gravações, transformando áudio em diálogo rotulado com precisão.

A transcrição responde o que foi dito. A diarização de locutores responde quem disse. É o passo que transforma um bloco de texto indiferenciado num diálogo legível — Locutor 1, depois Locutor 2, e de volta — e é o que torna a transcrição de uma entrevista, uma reunião ou um podcast utilizável em vez de um muro de palavras.

Uma definição em uma frase

A diarização de locutores é o processo de particionar uma gravação de áudio por quem fala — determinar "quem falou quando" e agrupar cada segmento sob um rótulo de locutor consistente, sem necessariamente conhecer as identidades reais dos locutores. Ela responde o quem, não o quem exatamente.

Essa última distinção confunde as pessoas, então merece uma tabela.

Diarização vs. reconhecimento vs. verificação

TarefaPergunta que respondePrecisa conhecer as pessoas de antemão?
Diarização de locutores"Quem falou quando?" (Locutor 1 vs. Locutor 2)Não
Reconhecimento / identificação de locutor"Qual pessoa conhecida é esta?"Sim — um conjunto de vozes conhecidas
Verificação de locutor"Esta é a pessoa específica que ela afirma ser?"Sim — uma identidade reivindicada

A diarização é a que você quer para transcrição. Ela não tenta dar nome a ninguém; apenas mantém cada voz distinta separada de forma consistente para que você possa rotulá-las depois ("Entrevistador", "Participante"). Reconhecimento e verificação são as tecnologias por trás da biometria de voz e do desbloqueio por voz — outro trabalho.

Como a diarização funciona, em breve

Por baixo dos panos, a maioria dos sistemas roda um pipeline mais ou menos assim:

  1. Detecção de atividade de voz — encontrar onde alguém fala e descartar o silêncio.
  2. Segmentação — cortar a fala em trechos curtos de um único locutor nos prováveis pontos de troca de locutor.
  3. Embedding — transformar cada trecho numa "impressão de voz" numérica que capta as características da voz.
  4. Agrupamento (clustering) — agrupar as impressões de voz para que trechos da mesma voz caiam juntos, produzindo Locutor 1, Locutor 2, e assim por diante.

A parte difícil costuma ser o agrupamento: muitas vezes o sistema tem que estimar quantos locutores existem em vez de ser informado, e vozes que soam parecidas são fáceis de mesclar por engano.

Onde ela falha

A diarização é genuinamente difícil, e conhecer os modos de falha ajuda você a gravar contornando-os:

  • Fala sobreposta. Quando duas pessoas falam ao mesmo tempo, um mesmo trecho de áudio pertence a dois locutores — difícil de dividir de forma limpa.
  • Vozes parecidas. Dois locutores com tom e sotaque próximos podem ser agrupados como um.
  • Turnos muito curtos. Um rápido "sim" ou "certo" dá ao sistema pouco áudio para trabalhar.
  • Sobreposição e microfones compartilhados. Um único microfone captando uma sala inteira borra os limites entre as pessoas.
  • Número de locutores desconhecido. Adivinhar errado o número de locutores divide uma pessoa em duas, ou funde duas em uma.

Nada disso é exclusivo das máquinas — os humanos também reouvem para desembaraçar uma reunião com vozes cruzadas. Como com as próprias palavras, trate os rótulos de locutor automáticos como um primeiro rascunho sólido e corrija os deslizes óbvios. (Sobre como a precisão das palavras é medida, veja qual a precisão da transcrição com IA.)

Por que importa para a sua transcrição

Os rótulos de locutor são a diferença entre uma transcrição com que você pode trabalhar e uma que você precisa reouvir:

  • Entrevistas se leem como uma troca real, e você pode citar o participante sem caçar quem disse o quê.
  • Reuniões viram ata: decisões e itens de ação se atam a uma pessoa.
  • Podcasts viram show notes e legendas onde o apresentador e o convidado são distintos.

Obtendo transcrições com rótulos de locutor

No ScribeToAny, ativar os rótulos de locutor marca cada segmento à medida que transcreve, então uma gravação com várias pessoas volta como um diálogo em vez de um bloco. O idioma falado é detectado automaticamente (cerca de 98 são suportados), e no editor do navegador, clicar em qualquer segmento reproduz aquele momento — a forma mais rápida de confirmar um limite de locutor ou corrigir um rótulo antes de exportar.

Para gravar visando uma boa diarização: dê a cada pessoa o seu próprio microfone se puder, mantenha uma sala silenciosa e incentive a alternância de turnos em vez de falar por cima. A separação limpa no áudio é do que depende a separação limpa na transcrição.

Também está integrada nas ferramentas por cenário — transcrição de reuniões, transcrição de entrevistas e transcrição de podcast esperam, cada uma, mais de uma voz. Para um fluxo de pesquisa completo com atribuição de locutor, veja como transcrever entrevistas de pesquisa; para transformar um episódio em show notes rotuladas, transcrição grátis de podcast para as show notes.


A diarização é o passo silencioso que torna uma transcrição legível — separa as vozes para que as palavras pertençam a alguém. Grave cada locutor de forma limpa, deixe a ferramenta rotular os turnos e corrija os poucos que ela erra. Comece com a transcrição de entrevistas e sua transcrição se lerá como uma conversa.