把音频转成文字
无需手动转码,一站式将任意音频录音转换为高精度、可搜索的文字稿。作为全面的音频转写总入口,ScribeToAny 支持包括 MP3、WAV、M4A、AAC、OGG 与 Opus 在内的所有主流音频格式,并为专业录音、语音备忘录及播客提供针对性处理。基于 Whisper 级 AI,覆盖约 98 种语言并自动区分发言人。
估算这段录音
全部在你的浏览器里完成,文件不会上传。
拖入音频或视频文件,或点击选择——文件只留在你的设备上。
使用方法
- 1
上传
拖入音频或视频文件,或粘贴链接,常见格式全部支持。
- 2
转录
AI 自动转录,带时间戳,可选说话人识别,通常几分钟完成。
- 3
导出
在线逐段编辑后,导出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。
为什么选 ScribeToAny
- 全容器通用兼容:直接拖入或上传任意音视频容器(MP3、WAV、M4A、AAC、OGG、Opus、FLAC、WMA 等),无需提前手动转码。
- 浏览器端即时估算:纯本地在设备上解析多媒体容器头信息,无需上传任何字节即可立即预估录音时长与大概字数。
- Whisper 级 AI 语音识别:覆盖约 98 种语言,自动划分清晰句段标点,并提供多发言人声纹分离识别(Diarization)。
- 丰富导出格式:支持排版就绪的文字文档(TXT、DOCX、PDF)与带精确时间戳的字幕及数据表格(SRT、VTT、CSV、JSON)。
常见问题
通用音频转文字总入口与 MP3、WAV 等格式专页有什么区别?
本页面是转录任意录音的通用入口。虽然底层 Whisper 引擎支持全部音频容器,但格式专页针对不同应用场景进行了深度优化:WAV 专注于无损专业录音,MP3 针对播客与压缩音频,M4A 直通 Apple 语音备忘录,OPUS 则对应社交通讯语音条。若已知文件格式,访问对应专页可获取针对性操作建议。
转录准确率如何?
ScribeToAny 在专用 GPU 上运行 Whisper 级语音模型,提供快速、平衡、准确三种模式。清晰录音下,「准确」模式的效果可与人工转录媲美,覆盖约 98 种语言,自动断句加标点。口音重、噪音大、多人插话的难搞音频,建议用「准确」模式并开启 AI 音频修复。转录后每段文字都可在浏览器中直接编辑,点击句子还能回放对应原声,几秒钟即可核对。
免费吗?
免费。免费账户每天 2 个文件、每月 100 分钟、单文件 30 分钟以内,无需绑卡,日常个人使用足够。付费方案把额度提高到每月 3000 分钟、单文件 3 小时 / 5 GB,并支持 6 个文件并行转录。
可以导出哪些格式?
共 8 种:纯文本 TXT,带时间轴的字幕 SRT、VTT,便于表格处理的 TSV、CSV,含逐段时间戳的结构化 JSON,以及可直接排版打印的 PDF、DOCX。文档格式可选择是否带逐段时间戳,高级导出还能一次打包多种格式为 ZIP——客户既要 Word 又要字幕时特别省事。
相关工具
免费开始转录
免费额度:每天 2 个文件、每月 100 分钟,无需绑卡。
免费开始转录