文字转 VTT
HTML5 视频只读 WebVTT,别的都不读,所以一份躺在文本文件里的文稿,在有了字幕条和时间轴之前对 <track> 元素毫无用处。本工具把每一行排成一条字幕,时长为你选定的固定值,并写出一个有效的 .vtt —— 足以先把字幕显示到屏幕上,再从那里去同步。
全部在你的浏览器里完成,文件不会上传。
还没有内容。
需要直接从视频生成字幕?上传视频即可,支持约 98 种语言。
免费试用为什么选 ScribeToAny
- 支持上传 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,视频自动提取音轨。
- 约 98 种语言,自动检测,基于专用 GPU 上的 Whisper 级引擎。
- 8 种导出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,还支持批量打包 ZIP。
- 说话人识别为每段标注发言者,点击任意句子即可回放对应原声。
常见问题
时间轴从哪里来?
它们是生成的,不是从任何音频取来的:每一行都用你设定的时长,从零开始首尾相接地排列。刻意做得可预测 —— 一个你能记在脑子里的规则容易校正,而一个自作聪明的猜测则不然。
生成的文件会是有效的 WebVTT 吗?
会。它以 WEBVTT 头部开头,并在毫秒前放一个点号 —— 这正是浏览器会因之拒收一个文件的两个细节。
我怎样才能得到和视频对得上的时间轴?
它们必须来自音频。把视频上传到 ScribeToAny,它会一并转录并给字幕定时,然后导出 VTT、SRT 及另外六种格式。
转换前我该怎么排版文本?
一行一条字幕——每行成为一条 cue——并在你想留空的地方加一个空行。把每行保持短到能在屏幕上读完(大约一个短句),因为转换器不会替你重新折行;它按你写的行原样处理。先把文本理顺,生成的 cue 之后就少很多微调。
我该把脚本做成 VTT 还是 SRT?
按字幕的去处来选。VTT 是 HTML5 视频在 <track> 元素里需要的,所以网页上的字幕选它。SRT 是更通用的交换格式,大多数桌面播放器和字幕编辑器更偏好它,所以若你要在编辑器里细调或喂给视频应用就选它。text-to-srt 工具对那个目标做的是同样的事;除此之外 cue 和时长完全一致。
相关工具
免费开始转录
免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。
免费开始转录