Quelle est la précision de la transcription par IA ? Le WER expliqué (2026)
Comprendre le taux d'erreur sur les mots (WER) : comment se mesure la précision d'une transcription IA et quels facteurs l'influencent réellement.
« Quelle est la précision de la transcription par IA ? » est la bonne question avec une réponse glissante, car la précision n'est pas un seul chiffre — elle dépend de l'audio. Le même système qui réussit parfaitement un enregistrement studio propre trébuche sur un appel bruyant à quatre. Pour en parler précisément, il faut la mesure que le domaine utilise réellement : le taux d'erreur sur les mots (WER, Word Error Rate).
Ce que signifie le taux d'erreur sur les mots
Le taux d'erreur sur les mots est la part des mots qu'une transcription se trompe, mesurée par rapport à une référence correcte. Il compte trois types d'erreur :
- Substitutions (S) — un mot erroné (« ces » pour « ses »).
- Suppressions (D) — un mot prononcé mais absent de la transcription.
- Insertions (I) — un mot dans la transcription qui n'a jamais été dit.
La formule divise ces erreurs par le nombre de mots de la référence (N) :
WER = (S + D + I) / N
Un exemple rapide. La référence est « on se voit lundi à midi » (6 mots). La transcription indique « on se voit mardi midi » : « lundi » → « mardi » est une substitution, et le « à » manquant est une suppression. Cela fait 2 erreurs sur 6 mots — un WER de 0,33, soit 33 %. Plus c'est bas, mieux c'est ; un WER de 4 % correspond à environ 96 % de précision.
Une réserve que le WER cache : il traite chaque erreur de la même façon. Avaler un « euh » et transformer un « ne » en « me » comptent tous deux pour une erreur, alors qu'une seule change le sens. Lisez un WER bas comme « presque juste », pas comme « publiable sans relecture ».
Alors, quels sont les vrais chiffres ?
Sur une parole lue et propre — un seul locuteur, bon micro, pas de bruit de fond — les systèmes modernes sont vraiment solides. Sur le benchmark très utilisé LibriSpeech test-clean, OpenAI a rapporté que ses modèles Whisper atteignaient un WER d'environ 3 %, les plus gros modèles encore plus bas.1 C'est dans la même fourchette qu'un humain soigneux.
Le hic, c'est que la plupart des enregistrements réels ne sont pas de la parole lue et propre. Sur un audio plus difficile — accents, chevauchement de voix, bruit de fond, conversation spontanée — le WER grimpe, souvent dans la fourchette 5–15 % ou pire selon les conditions. Le chiffre du benchmark est un plafond, pas ce que vous obtiendrez d'un enregistrement au téléphone dans un café.
Même les humains n'atteignent pas 100 %
Il est tentant de tenir l'IA à un standard « parfait », mais la transcription humaine ne l'est pas non plus. La transcription professionnelle soignée est souvent citée autour de 4 % de WER, et des études sur la parole conversationnelle ont montré que des transcripteurs humains experts ne sont pas d'accord entre eux d'environ 4–4,5 % sur un audio difficile — ils entendent différemment les mots ambigus.2 « 100 % de précision » n'est un objectif réaliste pour personne ; le but honnête est peu d'erreurs plus une relecture humaine de tout ce qui compte.
Ce qui fait vraiment bouger la précision
Si vous voulez une meilleure transcription, voici les leviers, à peu près par ordre d'impact :
- Le bruit de fond. Le facteur le plus déterminant. Une pièce silencieuse bat n'importe quel réglage logiciel.
- La distance et la qualité du micro. Un micro proche capte une parole propre ; le micro d'un ordinateur portable à l'autre bout de la table capte la pièce.
- La parole superposée. Des gens qui se parlent dessus, c'est difficile pour les machines (et les humains). Des micros séparés ou le respect des tours de parole aident énormément.
- Les accents et les dialectes. La couverture varie selon la langue et l'accent ; les accents régionaux marqués font monter le WER.
- Le vocabulaire spécialisé. Les noms, sigles, noms de médicaments, de produits et le jargon sont les substitutions les plus fréquentes, car ils sont rares dans la parole ordinaire.
- Le format et le débit audio. Un audio très compressé ou à faible débit jette le détail dont le modèle a besoin.
Comment obtenir la transcription la plus précise
- Enregistrez proprement. Micro proche, pièce silencieuse, une voix à la fois. Cela fait plus que n'importe quel post-traitement.
- Utilisez un fichier sans perte ou à haut débit (
wav, ou un bonmp3/m4a) plutôt qu'un fichier très compressé. - Séparez les locuteurs quand vous le pouvez — cela aide à la fois les mots et les étiquettes de locuteur. (Plus de détails dans qu'est-ce que la diarisation des locuteurs.)
- Vérifiez face à l'audio. Traitez la transcription automatique comme un premier jet. Dans ScribeToAny, cliquer sur un segment rejoue ce moment, le moyen le plus rapide de corriger un nom ou un terme mal entendu.
- Corrigez d'abord le vocabulaire. Les erreurs qui comptent sont en général des noms et du jargon — corrigez-les avant tout le reste.
En conclusion
Pour un audio propre, la transcription par IA en 2026 est proche du niveau humain et renvoie un résultat en minutes plutôt qu'en heures. Pour un audio brouillon, c'est un premier jet solide qui a encore besoin d'un passage humain — exactement là où vous voudriez de toute façon passer votre temps de relecture. Le chiffre à surveiller n'est pas un « 99 % de précision » marketing ; c'est le comportement de votre propre audio, et la facilité avec laquelle l'outil vous permet de le corriger.
Essayez sur votre propre fichier avec les outils audio vers texte, parole vers texte ou voix vers texte, et jugez la précision sur l'enregistrement que vous avez réellement.
La précision est autant une propriété de l'audio que du logiciel. Enregistrez bien, vérifiez ce que vous allez citer, et un faible taux d'erreur sur les mots devient une transcription en laquelle vous pouvez avoir confiance. Vous préférez ensuite une introduction aux formats ? Voir les formats de fichiers de sous-titres et de transcriptions expliqués.
Footnotes
-
Radford et al., « Robust Speech Recognition via Large-Scale Weak Supervision » (OpenAI, 2022) — Whisper atteint environ 3 % de WER sur LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩
-
Sur la transcription humaine soignée vs. rapide et le désaccord entre transcripteurs (~4–4,5 % de WER sur la parole conversationnelle), voir p. ex. Stolcke & Droppo, « Comparing Human and Machine Errors in Conversational Speech Transcription » (2017). https://arxiv.org/abs/1708.08615 ↩