把音訊翻譯成文字

一個真正保留原始結構的音訊翻譯工具。ScribeToAny 用約 98 種語言轉錄你的錄音,標出誰在說話,再把文字稿翻譯成 56 種語言中的任一種,而分段邊界和時間戳原封不動。這一點對採訪和會議尤其重要:你依然可以點一句譯文、聽回對應的原始音訊——這正是你核對一門自己讀不懂的語言的辦法。

免費開始轉錄免費額度:每天 2 個檔案、每月 100 分鐘,無需綁卡。

使用方法

  1. 1

    上傳

    拖入音訊或影片檔案,或貼上連結,常見格式全部支援。

  2. 2

    轉錄

    AI 自動轉錄,帶時間戳,可選說話人識別,通常幾分鐘完成。

  3. 3

    匯出

    線上逐段編輯後,匯出 TXT、SRT、VTT、TSV、CSV、JSON、PDF 或 DOCX。

為什麼選 ScribeToAny

  • 支援上傳 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV,影片自動提取音軌。
  • 約 98 種語言,自動檢測,基於專用 GPU 上的 Whisper 級引擎。
  • 8 種匯出格式:TXT、SRT、VTT、TSV、CSV、JSON、PDF、DOCX,還支援批次打包 ZIP。
  • 說話人識別為每段標註發言者,點選任意句子即可回放對應原聲。

常見問題

可以拿譯文和原始音訊對照嗎?

可以,而且這正是我們把翻譯綁定在文字稿上、而不是當成獨立文字任務來做的主要原因。每一段譯文都保留了它對應句子的時間戳,點一下就能重放那一刻的音訊。哪一段讀著不對,你可以立刻聽原聲,而不是靠猜。

能翻譯成多少種語言?

56 種目標語言,這個數字是刻意的:它們是翻譯模型真正訓練過、也做過基準評測的生產級語言,而不是它名義上能接受的幾百個語言碼。簡體中文和繁體中文分開提供,巴西葡語和歐洲葡語也分開——因為這些差別在字幕裡看得出來。

支援哪些音訊格式?

MP3、WAV、M4A、AAC、OGG、OPUS、WMA 等,以及任意影片容器——音軌會自動擷取。嘈雜錄音可以先過一道可選的 AI 修復,電話錄音和在咖啡廳錄的素材建議打開。

相關工具

免費開始轉錄

免費額度:每天 2 個檔案、每月 100 分鐘,無需綁卡。

免費開始轉錄