AI 전사는 얼마나 정확할까? WER 쉽게 이해하기 (2026)
단어 오류율(WER)과 AI 전사 정확도 완벽 해설: 측정 원리와 정확도에 영향을 미치는 주요 요인을 알아봅니다.
"AI 전사는 얼마나 정확할까?"는 옳은 질문이지만 답은 미끄럽습니다. 정확도는 하나의 숫자가 아니라 오디오에 달려 있기 때문입니다. 깨끗한 스튜디오 녹음을 완벽하게 처리하는 같은 시스템이 시끄러운 4인 통화에서는 헛디딥니다. 이를 정확히 이야기하려면 이 분야가 실제로 쓰는 지표, 즉 단어 오류율(WER, Word Error Rate) 이 필요합니다.
단어 오류율의 의미
단어 오류율은 올바른 기준(레퍼런스)과 대조해 전사가 틀리는 단어의 비율입니다. 세 가지 오류를 셉니다.
- 대치(S) — 잘못된 단어("반드시"를 "반듯이"로).
- 삭제(D) — 말했지만 전사에서 빠진 단어.
- 삽입(I) — 말하지 않았는데 전사에 있는 단어.
공식은 이 오류들을 기준의 단어 수(N)로 나눕니다.
WER = (S + D + I) / N
간단한 예. 기준이 "우리 다음 주 월요일 정오에 보자"(6개 단어)라고 합시다. 전사가 *"우리 다음 주 화요일 정오에"*로 나오면, "월요일" → "화요일"은 대치 하나, 빠진 "보자"는 삭제 하나입니다. 6개 단어 중 2개 오류 — WER은 **0.33, 즉 33%**입니다. 낮을수록 좋고, WER 4%는 약 96% 정확도를 뜻합니다.
WER이 감추는 한 가지 주의점: 모든 오류를 똑같이 취급합니다. "음"을 빠뜨리는 것과 "아니다"를 "아니라"로 바꾸는 것 모두 오류 하나로 세지만, 의미를 바꾸는 것은 한쪽뿐입니다. 낮은 WER은 "대체로 맞음"으로 읽되, "읽지 않고 게시해도 안전함"으로 읽지 마세요.
그래서 실제 숫자는?
깨끗한 낭독 음성 — 한 화자, 좋은 마이크, 배경 소음 없음 — 에서는 현대 시스템이 정말 강력합니다. 널리 쓰이는 LibriSpeech test-clean 벤치마크에서 OpenAI는 자사의 Whisper 모델이 WER **약 3%**에 도달했고, 가장 큰 모델은 그보다 더 낮다고 보고했습니다.1 이는 꼼꼼한 사람과 같은 범위입니다.
문제는 실제 녹음 대부분이 깨끗한 낭독 음성이 아니라는 점입니다. 더 어려운 오디오 — 억양, 말 겹침, 배경 소음, 즉흥적 대화 — 에서는 WER이 올라가, 조건에 따라 흔히 5~15% 범위나 그 이상이 됩니다. 벤치마크 숫자는 상한선이지, 카페에서 휴대폰으로 녹음한 것에서 얻을 값이 아닙니다.
사람조차 100%가 아니다
AI를 "완벽" 기준으로 재고 싶어지지만, 사람의 전사도 완벽하지 않습니다. 꼼꼼한 전문 전사는 흔히 WER 4% 안팎으로 인용되며, 대화체 음성 연구에서는 숙련된 사람 전사자들끼리도 어려운 오디오에서 약 4~4.5% 서로 어긋난다는 것이 밝혀졌습니다 — 모호한 단어를 다르게 듣는 것이죠.2 "100% 정확"은 누구에게도 현실적인 목표가 아닙니다. 정직한 목표는 낮은 오류 + 중요한 것은 사람이 검토 입니다.
정확도를 실제로 움직이는 것
더 나은 전사를 원한다면, 영향이 큰 순서대로 대략 다음 지렛대가 있습니다.
- 배경 소음. 단독으로 가장 큰 요인. 조용한 방이 어떤 소프트웨어 설정보다 낫습니다.
- 마이크 거리와 품질. 가까운 마이크는 깨끗한 음성을 담고, 탁자 건너편 노트북 마이크는 방을 담습니다.
- 겹치는 발화. 사람들이 서로 말을 겹치는 것은 기계(그리고 사람)에게 어렵습니다. 마이크를 나누거나 말차례를 지키면 크게 도움이 됩니다.
- 억양과 방언. 지원 범위는 언어와 억양마다 다르며, 강한 지역 억양은 WER을 올립니다.
- 분야 어휘. 이름, 약어, 약품명, 제품명, 전문 용어는 가장 흔한 대치입니다. 일상 발화에서 드물기 때문이죠.
- 오디오 형식과 비트레이트. 심하게 압축되거나 저비트레이트인 오디오는 모델이 필요로 하는 세부를 버립니다.
가장 정확한 전사를 얻는 법
- 깨끗하게 녹음하세요. 가까운 마이크, 조용한 방, 한 번에 한 목소리. 이것이 어떤 후처리보다 효과가 큽니다.
- 무손실 또는 고비트레이트 파일(
wav, 또는 좋은mp3/m4a)을 심하게 압축된 것 대신 쓰세요. - 화자를 분리하세요, 가능한 곳에서 — 단어에도 화자 라벨에도 도움이 됩니다. (자세한 내용은 화자 분리란 무엇인가.)
- 오디오와 대조해 확인하세요. 자동 전사는 초안으로 대하세요. ScribeToAny에서는 세그먼트를 클릭하면 그 순간이 재생되어, 잘못 들은 이름이나 용어를 고치는 가장 빠른 방법이 됩니다.
- 어휘부터 고치세요. 중요한 오류는 대개 이름과 전문 용어입니다 — 무엇보다 먼저 고치세요.
요점
깨끗한 오디오라면 2026년의 AI 전사는 사람 수준에 가깝고 몇 시간이 아니라 몇 분 만에 결과를 돌려줍니다. 지저분한 오디오라면 여전히 사람의 검토가 필요한 강력한 초안입니다 — 어차피 검토 시간을 쓰고 싶은 바로 그 지점이죠. 주목할 숫자는 "99% 정확"이라는 마케팅 주장이 아니라, 당신 자신의 오디오가 어떻게 동작하는지와, 도구가 얼마나 쉽게 고치게 해 주는지입니다.
오디오에서 텍스트로, 음성에서 텍스트로, 보이스에서 텍스트로 도구로 자신의 파일을 시험해 보고, 실제로 가진 녹음에서 정확도를 판단하세요.
정확도는 소프트웨어만큼이나 오디오의 속성입니다. 잘 녹음하고, 인용할 것을 확인하면, 낮은 단어 오류율은 믿을 수 있는 전사가 됩니다. 다음으로 형식 입문이 좋으신가요? 자막·전사 파일 형식 설명을 보세요.
Footnotes
-
Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (OpenAI, 2022) — Whisper는 LibriSpeech test-clean에서 약 3%의 WER에 도달한다. https://cdn.openai.com/papers/whisper.pdf ↩
-
꼼꼼한 사람 전사 대 빠른 전사, 그리고 전사자 간 불일치(대화체 음성에서 약 4~4.5% WER)에 관해서는 예를 들어 Stolcke & Droppo, "Comparing Human and Machine Errors in Conversational Speech Transcription" (2017)을 참고하세요. https://arxiv.org/abs/1708.08615 ↩