Wie genau ist KI-Transkription? Die WER erklärt (2026)
Wortfehlerrate (WER) verständlich erklärt: Wie KI-Transkriptionsgenauigkeit gemessen wird und welche Faktoren das Ergebnis beeinflussen.
„Wie genau ist KI-Transkription?“ ist die richtige Frage mit einer glitschigen Antwort, denn Genauigkeit ist keine einzelne Zahl — sie hängt vom Audio ab. Dasselbe System, das eine saubere Studioaufnahme perfekt trifft, stolpert bei einem lauten Vierer-Call. Um präzise darüber zu sprechen, braucht man die Kennzahl, die das Fachgebiet tatsächlich benutzt: die Wortfehlerrate (WER, Word Error Rate).
Was die Wortfehlerrate bedeutet
Die Wortfehlerrate ist der Anteil der Wörter, die ein Transkript falsch macht, gemessen an einer korrekten Referenz. Sie zählt drei Fehlerarten:
- Substitutionen (S) — ein falsches Wort („das“ statt „dass“).
- Auslassungen (D) — ein gesprochenes Wort, das im Transkript fehlt.
- Einfügungen (I) — ein Wort im Transkript, das nie gesagt wurde.
Die Formel teilt diese Fehler durch die Anzahl der Wörter in der Referenz (N):
WER = (S + D + I) / N
Ein kurzes Beispiel. Die Referenz lautet „wir treffen uns Montag um zwölf“ (6 Wörter). Das Transkript liest sich als „wir treffen Montag um elf“: „zwölf“ → „elf“ ist eine Substitution, und das fehlende „uns“ ist eine Auslassung. Das sind 2 Fehler auf 6 Wörter — eine WER von 0,33 bzw. 33 %. Niedriger ist besser; 4 % WER bedeutet rund 96 % Genauigkeit.
Ein Vorbehalt, den die WER verbirgt: Sie behandelt jeden Fehler gleich. Ein verschlucktes „äh“ und ein „nicht“, das zu „nun“ wird, zählen beide als ein Fehler, obwohl nur einer die Bedeutung ändert. Lies eine niedrige WER als „größtenteils richtig“, nicht als „sicher, ungelesen zu veröffentlichen“.
Wie sehen die tatsächlichen Zahlen aus?
Bei sauberer, gelesener Sprache — ein einzelner Sprecher, gutes Mikrofon, kein Hintergrundgeräusch — sind moderne Systeme wirklich stark. Auf dem weit verbreiteten LibriSpeech-Benchmark test-clean berichtete OpenAI, dass seine Whisper-Modelle eine WER um die 3 % erreichten, die größten Modelle noch niedriger.1 Das liegt im selben Bereich wie ein sorgfältiger Mensch.
Der Haken: Die meisten echten Aufnahmen sind keine saubere, gelesene Sprache. Bei schwierigerem Audio — Akzente, Durcheinanderreden, Hintergrundgeräusche, spontanes Gespräch — steigt die WER, oft in den Bereich 5–15 % oder schlechter, je nach Bedingungen. Die Benchmark-Zahl ist eine Obergrenze, nicht das, was du aus einer Handyaufnahme im Café bekommst.
Auch Menschen erreichen keine 100 %
Es ist verlockend, die KI an einem „perfekten“ Maßstab zu messen, aber menschliche Transkription ist auch nicht perfekt. Sorgfältige professionelle Transkription wird oft mit rund 4 % WER angegeben, und Studien zu Konversationssprache haben festgestellt, dass erfahrene menschliche Transkribierende bei schwierigem Audio um etwa 4–4,5 % voneinander abweichen — sie hören mehrdeutige Wörter unterschiedlich.2 „100 % genau“ ist für niemanden ein realistisches Ziel; das ehrliche Ziel ist wenig Fehler plus menschliche Prüfung von allem, was zählt.
Was die Genauigkeit wirklich bewegt
Wenn du ein besseres Transkript willst, sind das die Hebel, grob nach Wirkung geordnet:
- Hintergrundgeräusch. Der mit Abstand größte Faktor. Ein ruhiger Raum schlägt jede Softwareeinstellung.
- Mikrofonabstand und -qualität. Ein nahes Mikrofon nimmt saubere Sprache auf; ein Laptop-Mikrofon quer über den Tisch nimmt den Raum auf.
- Überlappende Sprache. Wenn Leute durcheinanderreden, ist das für Maschinen (und Menschen) schwer. Getrennte Mikrofone oder das Abwechseln beim Sprechen helfen enorm.
- Akzente und Dialekte. Die Abdeckung variiert je nach Sprache und Akzent; starke regionale Akzente erhöhen die WER.
- Fachvokabular. Namen, Abkürzungen, Medikamenten- und Produktnamen sowie Fachjargon sind die häufigsten Substitutionen, weil sie in der Alltagssprache selten sind.
- Audioformat und Bitrate. Stark komprimiertes oder niedrig-bitratiges Audio wirft Details weg, die das Modell braucht.
Wie du das genaueste Transkript bekommst
- Nimm sauber auf. Nahes Mikrofon, ruhiger Raum, eine Stimme nach der anderen. Das bringt mehr als jede Nachbearbeitung.
- Nutze eine verlustfreie oder hoch-bitratige Datei (
wavoder ein gutesmp3/m4a) statt einer stark komprimierten. - Trenne die Sprecher, wo du kannst — das hilft sowohl den Wörtern als auch den Sprecher-Labels. (Mehr dazu in was ist Sprecherdiarisierung.)
- Prüfe gegen das Audio. Behandle das automatische Transkript als ersten Entwurf. In ScribeToAny spielt ein Klick auf ein Segment diesen Moment erneut ab — der schnellste Weg, einen falsch gehörten Namen oder Begriff zu korrigieren.
- Korrigiere zuerst das Vokabular. Die Fehler, die zählen, sind meist Namen und Fachbegriffe — bring die vor allem anderen in Ordnung.
Das Fazit
Bei sauberem Audio ist KI-Transkription 2026 nahe am menschlichen Niveau und liefert ein Ergebnis in Minuten statt Stunden. Bei chaotischem Audio ist sie ein starker erster Entwurf, der noch einen menschlichen Durchgang braucht — genau dort, wo du deine Prüfzeit ohnehin investieren möchtest. Die Zahl, auf die es ankommt, ist keine Marketing-Behauptung von „99 % genau“; es ist, wie sich dein eigenes Audio verhält und wie leicht das Tool die Korrektur macht.
Probiere es mit deiner eigenen Datei mit den Tools Audio zu Text, Sprache zu Text oder Stimme zu Text und beurteile die Genauigkeit an der Aufnahme, die du tatsächlich hast.
Genauigkeit ist ebenso eine Eigenschaft des Audios wie der Software. Nimm gut auf, prüfe, was du zitieren wirst, und eine niedrige Wortfehlerrate wird zu einem Transkript, dem du vertrauen kannst. Als Nächstes lieber eine Einführung in die Formate? Siehe die Dateiformate für Untertitel und Transkripte erklärt.
Footnotes
-
Radford et al., „Robust Speech Recognition via Large-Scale Weak Supervision“ (OpenAI, 2022) — Whisper erreicht rund 3 % WER auf LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩
-
Zu sorgfältiger vs. schneller menschlicher Transkription und der Abweichung zwischen Transkribierenden (~4–4,5 % WER bei Konversationssprache) siehe z. B. Stolcke & Droppo, „Comparing Human and Machine Errors in Conversational Speech Transcription“ (2017). https://arxiv.org/abs/1708.08615 ↩