语音转文字,一次到位

ScribeToAny 在专用 GPU 上运行 Whisper 级语音识别:上传文件,选择快速、平衡或准确模式,即使有口音、术语和多人插话,也能得到经得起推敲的带时间戳文字稿。

免费开始转录免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

使用方法

  1. 1

    上传

    拖入音频或视频文件,或粘贴链接,常见格式全部支持。

  2. 2

    转录

    AI 自动转录,带时间戳,可选说话人识别,通常几分钟完成。

  3. 3

    导出

    在线逐段编辑后,导出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。

为什么选 ScribeToAny

  • 支持上传 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,视频自动提取音轨。
  • 约 98 种语言,自动检测,基于专用 GPU 上的 Whisper 级引擎。
  • 8 种导出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,还支持批量打包 ZIP。
  • 说话人识别为每段标注发言者,点击任意句子即可回放对应原声。

常见问题

三种转录模式有什么区别?

快速、平衡、准确对应三档 Whisper 级模型。「快速」出稿最快,适合清晰的单人音频;「准确」用最大模型,最能应付口音、术语和嘈杂录音;「平衡」(默认推荐)在速度与精度之间取中。模式按任务选择——草稿用快速、定稿用准确,其他设置完全不用动。

这是实时听写还是文件转录?

是文件转录。上传录好的音视频(或粘贴 YouTube 链接),获得完整的带时间戳文字稿。模型能看到整段录音的上下文,准确率显著高于逐词猜测的实时听写工具——还额外提供说话人标注、逐段编辑和 8 种导出格式。

我的音频隐私安全吗?

安全。文件通过 HTTPS 直传加密云存储,仅你的账户可见,绝不会用于训练 AI 模型。文字稿默认私密,除非你主动生成只读分享链接——链接随时可撤销。任何文件和文稿也都可以随时在工作台永久删除。

相关工具

语音转文字,一次到位

免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

免费开始转录