全部文章
指南2026/08/21

Captions 与 Subtitles 有什么区别?

Captions(隐藏式字幕)面向听不到声音的观众,包含非语音信息;Subtitles(翻译字幕)面向听得懂声音、但看不懂语言的观众,只呈现对白。一篇清晰的对比,附带决定你该用哪种的无障碍法规。

这两个词常被混用,但 captions 和 subtitles 并不是一回事,选错了甚至可能踩到无障碍法规的红线。

一句话概括:captions(隐藏式字幕) 假设观众听不到声音,因此会包含非语音的声音信息——背景音乐、关门声、谁在说话;subtitles(翻译字幕) 假设观众听得到、但听不懂这门语言,因此只承载对白。其余的区别,都从这一条派生出来。

一张表看懂 Captions vs. Subtitles

Captions(隐藏式字幕)Subtitles(翻译字幕)
假设观众听不到声音听得到、但听不懂语言
包含对白 + 非语音声音(音乐、音效、说话人标识)只有对白
主要受众聋人及听障观众用第二语言观看的人
与原声同语言?通常是通常不是(翻译过的)
是否法律强制?常常是——见下文很少;是本地化的选择
文件格式SRT、VTT、SCC、TTMLSRT、VTT、ASS/SSA

两者都是叠在画面上的定时文本,也都用同样的字幕文件格式——一个 .srt.vtt 既能装 caption,也能装 subtitle。区别在于每条字幕的内容,而不是容器本身。(关于容器那一面,见字幕与转录文件格式全解。)

Captions 比 Subtitles 多出来的东西

因为看 caption 的观众什么都听不到,caption 必须描述整条声轨,而不只是台词:

  • 非语音声音,用方括号标注:[电话铃响][紧张的音乐][笑声]
  • 说话人标识,这样即使人不在画面里,也知道是谁在说。
  • 语气与情绪,当它影响含义时——[讽刺地][低声]

Subtitles 会把这些全部丢掉。一条电影的翻译字幕假设你能听到爆炸声,它只告诉你角色说了什么。

开放式字幕 vs. 封闭式字幕(Open vs. Closed)

在 "captions" 内部,还有第二层区分:

  • 封闭式字幕(Closed Captions, CC) 是一条独立轨道,观众可以自行开关。YouTube 的字幕、播放器上的 CC 按钮、以及外挂的 .srt 文件,都是封闭式字幕。
  • 开放式字幕(Open Captions) 被永久烧录进画面像素里,永远显示、在任何播放器上都有、也没有开关按钮——常见于社交视频,因为那里默认静音自动播放、也没有字幕 UI。

出于无障碍考虑,封闭式是默认选择,因为它把控制权交给观众。而当你无法信任平台会正确渲染字幕轨道时——比如 TikTok 或 Instagram Reel——开放式字幕更稳妥。

SDH:夹在中间的混合体

你还会看到 SDH——"面向聋人及听障者的字幕"(subtitles for the deaf and hard of hearing)。SDH 是字幕形态的文本(走字幕的工作流和格式),但同时携带 caption 才有的非语音信息。它之所以存在,是因为蓝光和许多流媒体管线对字幕轨道的支持比对广播式 caption 更好,于是 SDH 就通过字幕通道来传递 caption 级别的信息。如果你要做无障碍字幕、但平台只收 subtitles,SDH 就是答案。

我到底该用哪种?

从你的观众倒推:

  • 面向大众发布视频(YouTube、课程、公司官网)? 你需要 captions——与原声同语言、带非语音提示。这也是无障碍法规所期待的。
  • 想让视频能被另一种语言的人看懂? 你需要 subtitles——把对白翻译出来。
  • 两者都要 很常见:同语言的 captions 加上一条或多条翻译过的 subtitle 轨道。流媒体平台正是这么做的。
  • 发到静音自动播放的社交信息流?开放式字幕,让文本无论播放器如何都能显示。

关于法律的一点说明

在美国,视频无障碍对多数机构而言不是可选项。《美国残疾人法》(ADA) 已被适用于网站及其视频,Section 508 覆盖联邦机构及其承包商,FCC 要求大量广播及其网络重发内容配备字幕。它们的共同点是 captions——准确、同语言、含非语音声音——而不是翻译字幕。如果你加定时文本的理由是合规,那你几乎一定需要的是 captions。以上为一般性信息,非法律意见;请核对适用于你所在机构的具体规定。

两种字幕都怎么做

两者的起点相同:一份准确、带时间戳的音频转录稿。

  1. 转录音频或视频。 上传文件让它转录——ScribeToAny 会自动检测所说语言(支持约 98 种),返回带时间戳的分段。如果画面里有多人,就打开说话人标注。
  2. 对照音频校对。 自动转录只是初稿。点击某一段会重播那一刻,是在字幕上线前修正听错的人名或术语最快的办法。
  3. 做 caption 就补上非语音提示。 这一步靠手动,正是它把一条字幕轨道变成 caption 轨道——把听不到声音的观众会错过的声响用方括号标出来。
  4. 导出对的文件。 SRTVTT 是多数平台都接受的封闭式轨道;如果某行停留过久或被截断,用 SRT 编辑器重新校对单条时间轴。
  5. 要做另一种语言, 就翻译定稿的转录。在 Max 方案上,ScribeToAny 会逐段翻译成 56 种语言之一,同时保持字幕时间轴不变,所以翻译后的 SRT 仍然对得上画面。

如果你想把文本烧进画面用于社交,先用字幕生成器生成轨道,再当作开放式字幕使用。


Captions 是为了无障碍,Subtitles 是为了跨语言。把转录一次做对,你就能从它同时产出两者。从视频转文字工具开始,在无障碍要求的地方手动补上非语音提示即可。