すべての記事
ガイド2026/08/21

AI 文字起こしの精度はどれくらい?WER をわかりやすく解説(2026)

単語誤り率(WER)をやさしく解説します。文字起こしの精度は実際どう測るのか、数字は何を意味するのか、なぜ人間でも 100% にならないのか、そして精度を上下させる要因まで。

「AI 文字起こしの精度はどれくらい?」は正しい問いですが、答えはつかみどころがありません。精度はひとつの数字ではなく、音声によって変わるからです。きれいなスタジオ録音を完璧に処理する同じシステムが、騒がしい 4 人の通話ではつまずきます。これを正確に語るには、この分野が実際に使う指標 — 単語誤り率(WER, Word Error Rate) が必要です。

単語誤り率とは

単語誤り率とは、正しい参照(リファレンス)と照らし合わせて、文字起こしが誤る単語の割合です。3 種類の誤りを数えます。

  • 置換(S) — 間違った単語(「以外」を「意外」に)。
  • 欠落(D) — 話されたのに文字起こしにない単語。
  • 挿入(I) — 話されていないのに文字起こしにある単語。

数式は、これらの誤りを参照の単語数(N)で割ります。

WER = (S + D + I) / N

簡単な例を。参照が 「月曜 の 正午 に 会い ましょう」(6 語)だとします。文字起こしが 「火曜 正午 に 会い ましょう」 となった場合、「月曜」→「火曜」で 1 置換、抜け落ちた「の」で 1 欠落。6 語中 2 誤り — WER は 0.33、つまり 33% です。低いほど良く、WER 4% はおよそ 96% の精度を意味します。

WER が隠すひとつの注意点:すべての誤りを同等に扱います。「えー」を落とすのも、「ない」を「ある」に変えるのも同じ 1 誤りと数えますが、意味を変えるのは一方だけです。低い WER は「おおむね正しい」と読み、「読まずに公開して安全」とは読まないでください。

では実際の数字は?

きれいな朗読音声 — 話者ひとり、良いマイク、背景雑音なし — なら、現代のシステムは本当に強力です。広く使われる LibriSpeech test-clean ベンチマークで、OpenAI は自社の Whisper モデルが WER 約 3% に達し、最大のモデルはさらに低いと報告しました。1 これは丁寧な人間と同じ範囲です。

問題は、現実の録音の多くがきれいな朗読音声ではないことです。難しい音声 — なまり、かぶり、背景雑音、自然な会話 — では WER が上がり、条件によってはしばしば 5〜15% の範囲かそれ以上になります。ベンチマークの数字は上限であって、カフェでスマホ録音したものから得られる値ではありません。

人間でも 100% ではない

AI を「完璧」の基準で測りたくなりますが、人間の文字起こしも完璧ではありません。丁寧なプロの文字起こしはしばしば WER 4% 前後とされ、会話音声の研究では、熟練の人間の書き起こし担当者どうしでも難しい音声で約 4〜4.5% 食い違う ことがわかっています — あいまいな語を別々に聞き取るのです。2 「100% 正確」は誰にとっても現実的な目標ではありません。誠実な目標は 低い誤り+重要な箇所は人間が確認 です。

精度を実際に動かすもの

より良い文字起こしが欲しいなら、影響の大きい順におおよそ次のレバーがあります。

  • 背景雑音。 単独で最大の要因。静かな部屋はどんなソフト設定にも勝ります。
  • マイクの距離と品質。 近いマイクはきれいな音声を捉え、テーブル越しのノート PC のマイクは部屋を捉えます。
  • 重なった発話。 人が同時に話すのは機械(そして人間)に難しい。マイクを分けたり、話す順番を守ったりすると大きく助かります。
  • なまりと方言。 対応は言語やなまりで差があり、強い地域なまりは WER を上げます。
  • 専門語彙。 名前、略語、薬品名、製品名、専門用語は最も多い置換です。日常の会話ではまれだからです。
  • 音声フォーマットとビットレート。 強く圧縮された、または低ビットレートの音声は、モデルが必要とする細部を捨ててしまいます。

最も正確な文字起こしを得るには

  1. きれいに録る。 近いマイク、静かな部屋、一度にひとつの声。これはどんな後処理よりも効きます。
  2. 可逆圧縮または高ビットレートのファイル(wav、あるいは良質な mp3/m4a)を、強く圧縮したものの代わりに使う。
  3. できる範囲で話者を分ける — 単語にも話者ラベルにも効きます。(詳しくは 話者ダイアライゼーションとは を。)
  4. 音声と照らし合わせて確認する。 自動文字起こしは下書きと捉えましょう。ScribeToAny ではセグメントをクリックするとその瞬間が再生され、聞き間違えた名前や用語を直す最速の方法になります。
  5. まず語彙を直す。 重要な誤りはたいてい名前と専門用語です — 何よりも先にそこを直しましょう。

結論

きれいな音声なら、2026 年の AI 文字起こしは人間並みに近く、数時間ではなく数分で結果を返します。雑然とした音声では、なお人間の一読を要する強力な下書きであり — どのみち確認の時間を割きたいのはまさにそこです。注目すべき数字は「99% 正確」というマーケティング表現ではなく、あなた自身の 音声がどう振る舞うか、そしてツールがどれだけ直しやすくしてくれるかです。

音声から文字起こし、音声認識、ボイスから文字起こし の各ツールで自分のファイルを試し、実際に手元にある録音で精度を判断してください。


精度はソフトウェアと同じくらい音声の性質でもあります。うまく録り、引用する箇所を確認すれば、低い単語誤り率は信頼できる文字起こしになります。次はフォーマット入門がよいですか? 字幕・書き起こしのファイル形式の解説 をどうぞ。

Footnotes

  1. Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision"(OpenAI, 2022)— Whisper は LibriSpeech test-clean でおよそ 3% の WER に達する。https://cdn.openai.com/papers/whisper.pdf ↩

  2. 丁寧な人間の文字起こしと速い文字起こし、および書き起こし担当者間の食い違い(会話音声で約 4〜4.5% の WER)については、例えば Stolcke & Droppo, "Comparing Human and Machine Errors in Conversational Speech Transcription"(2017)を参照。https://arxiv.org/abs/1708.08615 ↩