把音频转成文字

不用再一句句手打录音了。上传任意音频文件,ScribeToAny 几分钟内生成带时间戳的准确文字稿——基于 Whisper 级别的 AI 引擎,支持约 98 种语言,还能区分说话人。

免费开始转录免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

使用方法

  1. 1

    上传

    拖入音频或视频文件,或粘贴链接,常见格式全部支持。

  2. 2

    转录

    AI 自动转录,带时间戳,可选说话人识别,通常几分钟完成。

  3. 3

    导出

    在线逐段编辑后,导出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。

为什么选 ScribeToAny

  • 支持上传 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,视频自动提取音轨。
  • 约 98 种语言,自动检测,基于专用 GPU 上的 Whisper 级引擎。
  • 8 种导出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,还支持批量打包 ZIP。
  • 说话人识别为每段标注发言者,点击任意句子即可回放对应原声。

常见问题

支持上传哪些音频格式?

支持 13 种上传格式:音频 MP3、WAV、M4A、AAC、OGG、OPUS、WMA、WEBM,视频 MP4、MOV、MPEG、MPG、WMV——服务器自动提取音轨,无需事先转换。文件从浏览器直传加密云存储。免费账户单个文件最长 30 分钟,付费方案可到单文件 3 小时、最大 5 GB。

转录准确率如何?

ScribeToAny 在专用 GPU 上运行 Whisper 级语音模型,提供快速、平衡、准确三种模式。清晰录音下,「准确」模式的效果可与人工转录媲美,覆盖约 98 种语言,自动断句加标点。口音重、噪音大、多人插话的难搞音频,建议用「准确」模式并开启 AI 音频修复。转录后每段文字都可在浏览器中直接编辑,点击句子还能回放对应原声,几秒钟即可核对。

免费吗?

免费。免费账户每天 2 个文件、每月 100 分钟、单文件 30 分钟以内,无需绑卡,日常个人使用足够。付费方案把额度提高到每月 3000 分钟、单文件 3 小时 / 5 GB,支持 6 个文件并行转录,并以高优先级处理,出稿更快。

可以导出哪些格式?

共 8 种:纯文本 TXT,带时间轴的字幕 SRT、VTT,便于表格处理的 TSV、CSV,含逐段时间戳的结构化 JSON,以及可直接排版打印的 PDF、DOCX。文档格式可选择是否带逐段时间戳,高级导出还能一次打包多种格式为 ZIP——客户既要 Word 又要字幕时特别省事。

相关工具

把音频转成文字

免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。

免费开始转录