把音訊轉成文字

不用再一句句手打錄音了。上傳任意音訊檔案,ScribeToAny 幾分鐘內生成帶時間戳的準確文字稿——基於 Whisper 級別的 AI 引擎,支援約 98 種語言,還能區分說話人。

免費開始轉錄免費額度:每天 2 個檔案、每月 100 分鐘,無需綁卡。

使用方法

  1. 1

    上傳

    拖入音訊或影片檔案,或貼上連結,常見格式全部支援。

  2. 2

    轉錄

    AI 自動轉錄,帶時間戳,可選說話人識別,通常幾分鐘完成。

  3. 3

    匯出

    線上逐段編輯後,匯出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。

為什麼選 ScribeToAny

  • 支援上傳 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,影片自動提取音軌。
  • 約 98 種語言,自動檢測,基於專用 GPU 上的 Whisper 級引擎。
  • 8 種匯出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,還支援批次打包 ZIP。
  • 說話人識別為每段標註發言者,點選任意句子即可回放對應原聲。

常見問題

支援上傳哪些音訊格式?

支援 13 種上傳格式:音訊 MP3、WAV、M4A、AAC、OGG、OPUS、WMA、WEBM,影片 MP4、MOV、MPEG、MPG、WMV——伺服器自動提取音軌,無需事先轉換。檔案從瀏覽器直傳加密雲端儲存。免費賬戶單個檔案最長 30 分鐘,付費方案可到單檔案 3 小時、最大 5 GB。

轉錄準確率如何?

ScribeToAny 在專用 GPU 上執行 Whisper 級語音模型,提供快速、平衡、準確三種模式。清晰錄音下,「準確」模式的效果可與人工轉錄媲美,覆蓋約 98 種語言,自動斷句加標點。口音重、噪音大、多人插話的難搞音訊,建議用「準確」模式並開啟 AI 音訊修復。轉錄後每段文字都可在瀏覽器中直接編輯,點選句子還能回放對應原聲,幾秒鐘即可核對。

免費嗎?

免費。免費賬戶每天 2 個檔案、每月 100 分鐘、單檔案 30 分鐘以內,無需綁卡,日常個人使用足夠。付費方案把額度提高到每月 3000 分鐘、單檔案 3 小時 / 5 GB,支援 6 個檔案並行轉錄,並以高優先順序處理,出稿更快。

可以匯出哪些格式?

共 8 種:純文字 TXT,帶時間軸的字幕 SRT、VTT,便於表格處理的 TSV、CSV,含逐段時間戳的結構化 JSON,以及可直接排版列印的 PDF、DOCX。文件格式可選擇是否帶逐段時間戳,高階匯出還能一次打包多種格式為 ZIP——客戶既要 Word 又要字幕時特別省事。

相關工具

把音訊轉成文字

免費額度:每天 2 個檔案、每月 100 分鐘,無需綁卡。

免費開始轉錄