把音频转成文字
不用再一句句手打录音了。上传任意音频文件,ScribeToAny 几分钟内生成带时间戳的准确文字稿——基于 Whisper 级别的 AI 引擎,支持约 98 种语言,还能区分说话人。
使用方法
- 1
上传
拖入音频或视频文件,或粘贴链接,常见格式全部支持。
- 2
转录
AI 自动转录,带时间戳,可选说话人识别,通常几分钟完成。
- 3
导出
在线逐段编辑后,导出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。
为什么选 ScribeToAny
- 支持上传 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,视频自动提取音轨。
- 约 98 种语言,自动检测,基于专用 GPU 上的 Whisper 级引擎。
- 8 种导出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,还支持批量打包 ZIP。
- 说话人识别为每段标注发言者,点击任意句子即可回放对应原声。
常见问题
支持上传哪些音频格式?
支持 13 种上传格式:音频 MP3、WAV、M4A、AAC、OGG、OPUS、WMA、WEBM,视频 MP4、MOV、MPEG、MPG、WMV——服务器自动提取音轨,无需事先转换。文件从浏览器直传加密云存储。免费账户单个文件最长 30 分钟,付费方案可到单文件 3 小时、最大 5 GB。
转录准确率如何?
ScribeToAny 在专用 GPU 上运行 Whisper 级语音模型,提供快速、平衡、准确三种模式。清晰录音下,「准确」模式的效果可与人工转录媲美,覆盖约 98 种语言,自动断句加标点。口音重、噪音大、多人插话的难搞音频,建议用「准确」模式并开启 AI 音频修复。转录后每段文字都可在浏览器中直接编辑,点击句子还能回放对应原声,几秒钟即可核对。
免费吗?
免费。免费账户每天 2 个文件、每月 100 分钟、单文件 30 分钟以内,无需绑卡,日常个人使用足够。付费方案把额度提高到每月 3000 分钟、单文件 3 小时 / 5 GB,支持 6 个文件并行转录,并以高优先级处理,出稿更快。
可以导出哪些格式?
共 8 种:纯文本 TXT,带时间轴的字幕 SRT、VTT,便于表格处理的 TSV、CSV,含逐段时间戳的结构化 JSON,以及可直接排版打印的 PDF、DOCX。文档格式可选择是否带逐段时间戳,高级导出还能一次打包多种格式为 ZIP——客户既要 Word 又要字幕时特别省事。
相关工具
把音频转成文字
免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。
免费开始转录