Насколько точна ИИ-транскрипция? Разбираем WER (2026)
Коэффициент ошибок в словах (WER) и точность ИИ-транскрипции: как измеряется точность распознавания речи и что влияет на результат.
«Насколько точна ИИ-транскрипция?» — правильный вопрос со скользким ответом, потому что точность — это не одно число, она зависит от аудио. Та же система, что безупречно справляется с чистой студийной записью, спотыкается на шумном звонке вчетвером. Чтобы говорить об этом точно, нужна метрика, которую область действительно использует: частота ошибок по словам (WER, Word Error Rate).
Что означает частота ошибок по словам
Частота ошибок по словам — это доля слов, которые транскрипция передаёт неверно, измеренная относительно правильного эталона. Она считает три вида ошибок:
- Замены (S) — неправильное слово («компания» вместо «кампания»).
- Пропуски (D) — слово, которое было сказано, но отсутствует в транскрипции.
- Вставки (I) — слово в транскрипции, которое никогда не произносилось.
Формула делит эти ошибки на число слов в эталоне (N):
WER = (S + D + I) / N
Быстрый пример. Эталон — «давай встретимся в полдень в понедельник» (6 слов). Транскрипция гласит «давай встретимся полдень во вторник»: «понедельник» → «вторник» — одна замена, а пропущенное «в» — один пропуск. Это 2 ошибки на 6 слов — WER 0,33, или 33%. Чем ниже, тем лучше; WER 4% означает около 96% точности.
Одна оговорка, которую WER скрывает: она считает все ошибки равными. Проглоченное «э-э» и превращение «не» в «но» — оба считаются одной ошибкой, хотя смысл меняет только одно из них. Читайте низкий WER как «в основном правильно», а не как «можно публиковать не читая».
Так каковы реальные цифры?
На чистой, читаемой речи — один говорящий, хороший микрофон, без фонового шума — современные системы по-настоящему сильны. На широко используемом бенчмарке LibriSpeech test-clean OpenAI сообщила, что её модели Whisper достигают WER около 3%, а крупнейшие модели — ещё ниже.1 Это тот же диапазон, что и у аккуратного человека.
Загвоздка в том, что большинство реальных записей — не чистая читаемая речь. На более сложном аудио — акценты, перекрёстные реплики, фоновый шум, спонтанный разговор — WER растёт, часто до диапазона 5–15% или хуже в зависимости от условий. Цифра бенчмарка — это потолок, а не то, что вы получите с записи на телефон в кафе.
Даже люди не на 100%
Заманчиво держать ИИ к «идеальному» стандарту, но человеческая транскрипция тоже не идеальна. Тщательную профессиональную транскрипцию часто оценивают примерно в 4% WER, а исследования разговорной речи показали, что опытные транскрибаторы-люди расходятся между собой примерно на 4–4,5% на трудном аудио — они по-разному слышат неоднозначные слова.2 «100% точности» — нереалистичная цель ни для кого; честная цель — низкая ошибка плюс проверка человеком всего, что важно.
Что действительно двигает точность
Если вам нужна транскрипция получше, вот рычаги, примерно по порядку влияния:
- Фоновый шум. Самый крупный отдельный фактор. Тихая комната бьёт любую настройку программы.
- Дистанция и качество микрофона. Близкий микрофон ловит чистую речь; микрофон ноутбука через стол ловит комнату.
- Перекрывающаяся речь. Когда люди говорят друг поверх друга, это трудно для машин (и людей). Раздельные микрофоны или очерёдность реплик помогают колоссально.
- Акценты и диалекты. Охват различается по языку и акценту; сильные региональные акценты повышают WER.
- Отраслевая лексика. Имена, аббревиатуры, названия лекарств, продуктов и жаргон — самые частые замены, потому что в обычной речи они редки.
- Формат и битрейт аудио. Сильно сжатое или низкобитрейтное аудио выбрасывает детали, нужные модели.
Как получить самую точную транскрипцию
- Записывайте чисто. Близкий микрофон, тихая комната, по одному голосу за раз. Это даёт больше, чем любая постобработка.
- Используйте файл без потерь или с высоким битрейтом (
wavили хорошийmp3/m4a) вместо сильно сжатого. - Разделяйте говорящих, где можете — это помогает и словам, и меткам говорящих. (Подробнее в что такое диаризация говорящих.)
- Сверяйте с аудио. Относитесь к автоматической транскрипции как к черновику. В ScribeToAny клик по сегменту воспроизводит этот момент — самый быстрый способ исправить неверно расслышанное имя или термин.
- Сначала правьте лексику. Ошибки, которые важны, — это обычно имена и жаргон; исправляйте их прежде всего.
Итог
Для чистого аудио ИИ-транскрипция в 2026 году близка к человеческому уровню и возвращает результат за минуты, а не за часы. Для беспорядочного аудио это сильный черновик, которому всё ещё нужен проход человека — как раз там, где вы и хотели бы тратить время на проверку. Цифра, за которой стоит следить, — не маркетинговое заявление о «99% точности»; это то, как ведёт себя ваше собственное аудио и насколько легко инструмент позволяет его исправить.
Попробуйте на своём файле с инструментами аудио в текст, речь в текст или голос в текст и судите о точности по той записи, которая у вас на самом деле есть.
Точность — это в той же мере свойство аудио, что и программы. Записывайте хорошо, проверяйте то, что будете цитировать, и низкая частота ошибок по словам превращается в транскрипцию, которой можно доверять. Хотите дальше введение в форматы? См. форматы файлов субтитров и транскрипций с пояснениями.
Footnotes
-
Radford et al., «Robust Speech Recognition via Large-Scale Weak Supervision» (OpenAI, 2022) — Whisper достигает примерно 3% WER на LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩
-
О тщательной и быстрой человеческой транскрипции и расхождении между транскрибаторами (~4–4,5% WER на разговорной речи) см., напр., Stolcke & Droppo, «Comparing Human and Machine Errors in Conversational Speech Transcription» (2017). https://arxiv.org/abs/1708.08615 ↩