把音频翻译成文字

一个真正保留原始结构的音频翻译工具。ScribeToAny 用约 98 种语言转录你的录音,标出谁在说话,再把文字稿翻译成 56 种语言中的任意一种,而分段边界和时间戳原封不动。这一点对采访和会议尤其重要:你依然可以点一句译文、听回对应的原始音频——这正是你核对一门自己读不懂的语言的办法。

免费开始转录免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

使用方法

  1. 1

    上传

    拖入音频或视频文件,或粘贴链接,常见格式全部支持。

  2. 2

    转录

    AI 自动转录,带时间戳,可选说话人识别,通常几分钟完成。

  3. 3

    导出

    在线逐段编辑后,导出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。

为什么选 ScribeToAny

  • 支持上传 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,视频自动提取音轨。
  • 约 98 种语言,自动检测,基于专用 GPU 上的 Whisper 级引擎。
  • 8 种导出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,还支持批量打包 ZIP。
  • 说话人识别为每段标注发言者,点击任意句子即可回放对应原声。

常见问题

可以拿译文和原始音频对照吗?

可以,而且这正是我们把翻译绑定在文字稿上、而不是当成独立文本任务来做的主要原因。每一段译文都保留了它对应句子的时间戳,点一下就能重放那一刻的音频。哪一段读着不对,你可以立刻听原声,而不是靠猜。

能翻译成多少种语言?

56 种目标语言,这个数字是刻意的:它们是翻译模型真正训练过、也做过基准评测的生产级语言,而不是它名义上能接受的几百个语言码。简体中文和繁体中文分开提供,巴西葡语和欧洲葡语也分开——因为这些差别在字幕里看得出来。

支持哪些音频格式?

MP3、WAV、M4A、AAC、OGG、OPUS、WMA 等,以及任意视频容器——音轨会自动提取。嘈杂录音可以先过一道可选的 AI 修复,电话录音和在咖啡馆录的素材建议打开。

相关工具

免费开始转录

免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

免费开始转录