全部文章
指南2026/08/21

AI 转录到底有多准?讲清 WER(2026)

用大白话讲清词错误率(Word Error Rate)——转录准确率到底怎么测、数字意味着什么、为什么连人类都做不到 100%,以及哪些因素会把准确率拉高或拉低。

"AI 转录有多准?"是个对的问题,但答案很滑,因为准确率不是一个数字——它取决于音频。同一套系统,处理干净的录音室录音能做到极准,碰上嘈杂的四人通话就会磕绊。要精确地谈它,你需要这个领域真正在用的指标:词错误率(Word Error Rate,WER)。

词错误率是什么意思

词错误率,就是转录相对于正确参考稿说错的词所占的比例。它数三类错误:

  • 替换(Substitution, S)——说错了词(把 "在意" 认成 "再一")。
  • 删除(Deletion, D)——说了、但转录里漏掉的词。
  • 插入(Insertion, I)——转录里多出来、根本没说过的词。

公式把这些错误除以参考稿的词数(N):

WER = (S + D + I) / N

举个例子。参考句是 "我们 明天 上午 十点 开会"(5 个词)。转录成了 "我们 明天 上午 开花":漏掉 "十点" 是一个删除,"开会" → "开花" 是一个替换。那就是 2 个错、除以 5 个词——WER 为 0.4,即 40%。越低越好;4% 的 WER 约等于 96% 的准确率。(中文按"词"切分,切法不同会略微影响计数,但道理一样。)

WER 藏了一个要点:它把每个错误都当成等价。漏掉一个 "嗯" 和把 "会" 认成 "不会",都只算一个错,尽管只有后者改变了含义。请把低 WER 读作"大体正确",而不是"可以不看直接发布"。

那实际数字是多少?

在干净的朗读语音上——单一说话人、好麦克风、没有背景噪音——现代系统确实很强。在广泛使用的 LibriSpeech test-clean 基准上,OpenAI 报告其 Whisper 模型的 WER 约为 3%,最大的模型还更低。1 这已经和一位仔细的人类处在同一区间。

问题在于,多数真实录音并不是干净的朗读语音。碰上更难的音频——口音、串音、背景噪音、自发的对话——WER 会攀升,视条件常常落到 5–15% 甚至更差。基准数字是天花板,不是你用手机在咖啡馆录出来能拿到的。

连人类都做不到 100%

人们容易用"完美"的标准去要求 AI,但人类转录也不完美。仔细的专业转录常被引用在 4% 左右的 WER,而针对对话语音的研究发现,专家人类转录员在困难音频上彼此之间的分歧就有大约 4–4.5%——他们对模糊的词听法不同。2 "100% 准确"对谁都不是一个现实目标;诚实的目标是低错误率,加上对重要之处的人工复核。

真正影响准确率的因素

如果你想要更好的转录稿,这些是可调的杠杆,大致按影响从大到小排列:

  • 背景噪音。 单一最大因素。安静的房间胜过任何软件设置。
  • 麦克风距离与质量。 近距麦克风收到干净的人声;隔着桌子的笔记本麦克风收到的是整个房间。
  • 串音(同时说话)。 人们互相抢话对机器(和人类)都很难。分开的麦克风或轮流发言帮助极大。
  • 口音与方言。 覆盖度因语言和口音而异;浓重的地方口音会拉高 WER。
  • 领域词汇。 人名、缩写、药名、产品名和行话是最常见的替换错误,因为它们在日常口语里很少见。
  • 音频格式与码率。 高度压缩或低码率的音频会丢掉模型需要的细节。

如何拿到最准的转录稿

  1. 录得干净。 近距麦克风、安静房间、一次一个人说。这比任何后期处理都管用。
  2. 用无损或高码率的文件(wav,或质量好的 mp3/m4a),而不是被高度压缩的。
  3. 尽量分离说话人——它对文字和说话人标注都有帮助。(更多见什么是说话人分离。)
  4. 对照音频校对。 把自动转录当初稿。在 ScribeToAny 里点击某一段会重播那一刻,是修正听错人名或术语最快的办法。
  5. 先改词汇。 真正要命的错误通常是人名和行话——先把它们改对,再看别的。

结论

对于干净的音频,2026 年的 AI 转录已接近人类水平,而且几分钟就出结果,而不是几小时。对于杂乱的音频,它是一份强有力的初稿、仍需人工过一遍——而这恰恰是你本来就该花复核时间的地方。要盯的数字不是营销话术里的"99% 准确",而是你自己的音频表现如何、以及工具让你改起来有多顺手。

拿你自己的文件试试音频转文字、语音转文字或声音转文字工具,用你手上真实的录音去判断准确率。


准确率既是软件的属性,也是音频的属性。录好、复核你要引用的部分,一个低的词错误率就会变成一份你信得过的转录稿。想接着看格式入门?见字幕与转录文件格式全解。

Footnotes

  1. Radford 等,《Robust Speech Recognition via Large-Scale Weak Supervision》(OpenAI,2022)——Whisper 在 LibriSpeech test-clean 上的 WER 约为 3%。https://cdn.openai.com/papers/whisper.pdf ↩

  2. 关于仔细 vs. 快速的人类转录、以及转录员之间的分歧(对话语音上约 4–4.5% 的 WER),参见 Stolcke & Droppo,《Comparing Human and Machine Errors in Conversational Speech Transcription》(2017)。https://arxiv.org/abs/1708.08615 ↩