全部文章
指南2026/08/21

什么是说话人分离?AI 如何弄清谁在说话

说话人分离(Speaker Diarization)是按说话人把录音切开的那一步——把一整块文字变成有标注的对话。它是什么、和说话人识别有何不同、如何运作、以及在哪里会出错。

转录回答说了什么。说话人分离回答是谁说的。它是把一整块混在一起的文字变成可读对话的那一步——说话人 1,接着说话人 2,再切回来——正是它让一段访谈、会议或播客的转录稿变得能用,而不是一堵文字墙。

一句话定义

说话人分离,就是按说话人把一段录音切分开——判断"谁在什么时候说话",并把每一段都归到一个一致的说话人标签下,而不必知道说话人的真实身份。它回答的是,而不是具体是谁

最后这点区别常把人绊住,值得单开一张表。

分离 vs. 识别 vs. 验证

任务它回答的问题是否需要事先知道这些人?
说话人分离(Diarization)"谁在什么时候说话?"(说话人 1 vs. 说话人 2)
说话人识别(Recognition / Identification)"这是哪个已知的人?"是——需要一组已知声音
说话人验证(Verification)"这是不是他声称的那个特定的人?"是——需要一个声称的身份

用于转录,你要的是分离。它不试图给谁起名,只是把每个不同的声音持续地分开,好让你事后自己去贴标签("采访者""受访者")。识别和验证是声纹和语音解锁背后的技术——那是另一份活。

分离大致怎么运作

在底层,多数系统跑的流水线大致是这样:

  1. 语音活动检测——找出任何人在说话的地方,把静音丢掉。
  2. 切分——在可能的说话人切换点,把语音切成短的、单一说话人的片段。
  3. 嵌入(Embedding)——把每个片段变成一段能刻画该声音特征的数字"声纹"。
  4. 聚类——把声纹分组,让同一个声音的片段聚到一起,产出说话人 1、说话人 2,以此类推。

难的通常是聚类:系统往往得自己估计有几个说话人、而不是被告知,于是听起来相近的声音很容易被错误地合并。

它在哪里会出错

分离确实难,了解这些失败模式能帮你在录音时规避:

  • 同时说话(串音)。 当两个人一起说时,同一段音频同时属于两个说话人——很难干净地切开。
  • 相似的声音。 音高和口音接近的两个说话人,可能被聚成一个。
  • 极短的发言。 一句飞快的 "嗯" 或 "对",留给系统的音频太少。
  • 串音与共用麦克风。 一支麦克风收整个房间,会把人与人之间的边界糊掉。
  • 未知的说话人数量。 猜错人数,会把一个人拆成两个,或把两个人并成一个。

这些没一个是机器独有的——人类也要靠回放去理清一场抢话的会议。和文字本身一样,把自动的说话人标签当成强有力的初稿,把明显的失误改掉就好。(关于文字层面准确率怎么测,见AI 转录到底有多准。)

它为什么对你的转录稿重要

说话人标签,是"能直接用的转录稿"和"还得回去重听的转录稿"之间的差别:

  • 访谈读起来像一场真实的对话,你无需翻找是谁说的,就能引用受访者。
  • 会议变成会议纪要:决定和待办能挂到具体的人身上。
  • 播客变成主持人和嘉宾各自分明的节目笔记与字幕。

如何拿到带说话人标注的转录稿

ScribeToAny 里,打开说话人标注后,转录时每一段都会被打上标签,于是多人录音回来时是一段对话、而不是一堵文字墙。所说语言会被自动检测(支持约 98 种),在浏览器编辑器里点击任意一段会重播那一刻——这是在导出前确认说话人边界、或修正某个标签最快的办法。

想要利于分离的录音效果:尽量给每个人各自一支麦克风、保持房间安静、鼓励轮流发言而不是抢话。转录里干净的分离,取决于音频里干净的分离。

它也内建在按场景细分的工具里——会议转录访谈转录播客转录都默认不止一个声音。想要带说话人归属的完整研究工作流,见如何转录研究访谈;想把一期节目变成带标注的节目笔记,见用免费播客转录做节目笔记


分离是让转录稿变得可读的那一步安静功夫——它把声音分开,好让文字有归属。把每个说话人录干净、让工具去标注每一次发言、再改掉它出错的那几处。从访谈转录开始,你的转录稿就会读起来像一场对话。