Все статьи
Руководства2026/08/21

Насколько точна ИИ-транскрипция? Разбираем WER (2026)

Коэффициент ошибок в словах (WER) и точность ИИ-транскрипции: как измеряется точность распознавания речи и что влияет на результат.

«Насколько точна ИИ-транскрипция?» — правильный вопрос со скользким ответом, потому что точность — это не одно число, она зависит от аудио. Та же система, что безупречно справляется с чистой студийной записью, спотыкается на шумном звонке вчетвером. Чтобы говорить об этом точно, нужна метрика, которую область действительно использует: частота ошибок по словам (WER, Word Error Rate).

Что означает частота ошибок по словам

Частота ошибок по словам — это доля слов, которые транскрипция передаёт неверно, измеренная относительно правильного эталона. Она считает три вида ошибок:

  • Замены (S) — неправильное слово («компания» вместо «кампания»).
  • Пропуски (D) — слово, которое было сказано, но отсутствует в транскрипции.
  • Вставки (I) — слово в транскрипции, которое никогда не произносилось.

Формула делит эти ошибки на число слов в эталоне (N):

WER = (S + D + I) / N

Быстрый пример. Эталон — «давай встретимся в полдень в понедельник» (6 слов). Транскрипция гласит «давай встретимся полдень во вторник»: «понедельник» → «вторник» — одна замена, а пропущенное «в» — один пропуск. Это 2 ошибки на 6 слов — WER 0,33, или 33%. Чем ниже, тем лучше; WER 4% означает около 96% точности.

Одна оговорка, которую WER скрывает: она считает все ошибки равными. Проглоченное «э-э» и превращение «не» в «но» — оба считаются одной ошибкой, хотя смысл меняет только одно из них. Читайте низкий WER как «в основном правильно», а не как «можно публиковать не читая».

Так каковы реальные цифры?

На чистой, читаемой речи — один говорящий, хороший микрофон, без фонового шума — современные системы по-настоящему сильны. На широко используемом бенчмарке LibriSpeech test-clean OpenAI сообщила, что её модели Whisper достигают WER около 3%, а крупнейшие модели — ещё ниже.1 Это тот же диапазон, что и у аккуратного человека.

Загвоздка в том, что большинство реальных записей — не чистая читаемая речь. На более сложном аудио — акценты, перекрёстные реплики, фоновый шум, спонтанный разговор — WER растёт, часто до диапазона 5–15% или хуже в зависимости от условий. Цифра бенчмарка — это потолок, а не то, что вы получите с записи на телефон в кафе.

Даже люди не на 100%

Заманчиво держать ИИ к «идеальному» стандарту, но человеческая транскрипция тоже не идеальна. Тщательную профессиональную транскрипцию часто оценивают примерно в 4% WER, а исследования разговорной речи показали, что опытные транскрибаторы-люди расходятся между собой примерно на 4–4,5% на трудном аудио — они по-разному слышат неоднозначные слова.2 «100% точности» — нереалистичная цель ни для кого; честная цель — низкая ошибка плюс проверка человеком всего, что важно.

Что действительно двигает точность

Если вам нужна транскрипция получше, вот рычаги, примерно по порядку влияния:

  • Фоновый шум. Самый крупный отдельный фактор. Тихая комната бьёт любую настройку программы.
  • Дистанция и качество микрофона. Близкий микрофон ловит чистую речь; микрофон ноутбука через стол ловит комнату.
  • Перекрывающаяся речь. Когда люди говорят друг поверх друга, это трудно для машин (и людей). Раздельные микрофоны или очерёдность реплик помогают колоссально.
  • Акценты и диалекты. Охват различается по языку и акценту; сильные региональные акценты повышают WER.
  • Отраслевая лексика. Имена, аббревиатуры, названия лекарств, продуктов и жаргон — самые частые замены, потому что в обычной речи они редки.
  • Формат и битрейт аудио. Сильно сжатое или низкобитрейтное аудио выбрасывает детали, нужные модели.

Как получить самую точную транскрипцию

  1. Записывайте чисто. Близкий микрофон, тихая комната, по одному голосу за раз. Это даёт больше, чем любая постобработка.
  2. Используйте файл без потерь или с высоким битрейтом (wav или хороший mp3/m4a) вместо сильно сжатого.
  3. Разделяйте говорящих, где можете — это помогает и словам, и меткам говорящих. (Подробнее в что такое диаризация говорящих.)
  4. Сверяйте с аудио. Относитесь к автоматической транскрипции как к черновику. В ScribeToAny клик по сегменту воспроизводит этот момент — самый быстрый способ исправить неверно расслышанное имя или термин.
  5. Сначала правьте лексику. Ошибки, которые важны, — это обычно имена и жаргон; исправляйте их прежде всего.

Итог

Для чистого аудио ИИ-транскрипция в 2026 году близка к человеческому уровню и возвращает результат за минуты, а не за часы. Для беспорядочного аудио это сильный черновик, которому всё ещё нужен проход человека — как раз там, где вы и хотели бы тратить время на проверку. Цифра, за которой стоит следить, — не маркетинговое заявление о «99% точности»; это то, как ведёт себя ваше собственное аудио и насколько легко инструмент позволяет его исправить.

Попробуйте на своём файле с инструментами аудио в текст, речь в текст или голос в текст и судите о точности по той записи, которая у вас на самом деле есть.


Точность — это в той же мере свойство аудио, что и программы. Записывайте хорошо, проверяйте то, что будете цитировать, и низкая частота ошибок по словам превращается в транскрипцию, которой можно доверять. Хотите дальше введение в форматы? См. форматы файлов субтитров и транскрипций с пояснениями.

Footnotes

  1. Radford et al., «Robust Speech Recognition via Large-Scale Weak Supervision» (OpenAI, 2022) — Whisper достигает примерно 3% WER на LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩

  2. О тщательной и быстрой человеческой транскрипции и расхождении между транскрибаторами (~4–4,5% WER на разговорной речи) см., напр., Stolcke & Droppo, «Comparing Human and Machine Errors in Conversational Speech Transcription» (2017). https://arxiv.org/abs/1708.08615 ↩