Todas las publicaciones
Guías2026/08/21

¿Qué precisión tiene la transcripción con IA? El WER explicado (2026)

Explicación clara de la tasa de error de palabra (WER): cómo se mide la precisión de la transcripción IA y qué factores influyen en el resultado.

"¿Qué precisión tiene la transcripción con IA?" es la pregunta correcta con una respuesta escurridiza, porque la precisión no es un solo número — depende del audio. El mismo sistema que clava una grabación limpia de estudio tropieza en una llamada ruidosa de cuatro personas. Para hablar de ello con precisión, hace falta la métrica que el campo realmente usa: la tasa de error de palabra (WER, Word Error Rate).

Qué significa la tasa de error de palabra

La tasa de error de palabra es la proporción de palabras que una transcripción equivoca, medida contra una referencia correcta. Cuenta tres tipos de error:

  • Sustituciones (S) — una palabra incorrecta ("haya" por "halla").
  • Eliminaciones (D) — una palabra que se dijo pero falta en la transcripción.
  • Inserciones (I) — una palabra en la transcripción que nunca se dijo.

La fórmula divide esos errores entre el número de palabras de la referencia (N):

WER = (S + D + I) / N

Un ejemplo rápido. La referencia es "quedamos a las doce el lunes" (6 palabras). La transcripción dice "quedamos las doce lunes": falta "a" (una eliminación) y falta "el" (otra eliminación). Son 2 errores sobre 6 palabras — un WER de 0,33, o 33 %. Cuanto más bajo, mejor; un WER del 4 % significa alrededor del 96 % de precisión.

Una salvedad que el WER oculta: trata todos los errores por igual. Comerse un "eh" y convertir un "no" en un "yo" cuentan ambos como un error, aunque solo uno cambie el significado. Lee un WER bajo como "casi todo correcto", no como "seguro para publicar sin leer".

Entonces, ¿cuáles son los números reales?

Con habla leída y limpia — un solo hablante, buen micrófono, sin ruido de fondo — los sistemas modernos son de verdad sólidos. En el conocido benchmark LibriSpeech test-clean, OpenAI informó de que sus modelos Whisper alcanzaban un WER en torno al 3 %, y los modelos más grandes aún más bajo.1 Eso está en el mismo rango que un humano cuidadoso.

El truco es que la mayoría de las grabaciones reales no son habla leída y limpia. Con audio más difícil — acentos, diafonía, ruido de fondo, conversación espontánea — el WER sube, a menudo al rango del 5–15 % o peor según las condiciones. El número del benchmark es un techo, no lo que obtendrás de una grabación de móvil en una cafetería.

Ni siquiera los humanos llegan al 100 %

Es tentador exigir a la IA un estándar "perfecto", pero la transcripción humana tampoco lo es. La transcripción profesional cuidadosa se cita a menudo alrededor de un 4 % de WER, y estudios del habla conversacional han encontrado que los transcriptores humanos expertos discrepan entre sí en torno a un 4–4,5 % con audio difícil — oyen de forma distinta las palabras ambiguas.2 "100 % de precisión" no es un objetivo real para nadie; la meta honesta es poco error más revisión humana de todo lo que importe.

Qué mueve de verdad la precisión

Si quieres una transcripción mejor, estas son las palancas, más o menos por orden de impacto:

  • Ruido de fondo. El factor más determinante. Una sala silenciosa gana a cualquier ajuste de software.
  • Distancia y calidad del micrófono. Un micro cercano capta habla limpia; el micro de un portátil al otro lado de la mesa capta la sala.
  • Habla superpuesta. La gente hablando a la vez es difícil para las máquinas (y para los humanos). Micrófonos separados o los turnos de palabra ayudan enormemente.
  • Acentos y dialectos. La cobertura varía según el idioma y el acento; los acentos regionales marcados suben el WER.
  • Vocabulario del dominio. Nombres, siglas, nombres de fármacos, de productos y jerga son las sustituciones más comunes, porque son raros en el habla corriente.
  • Formato y tasa de bits del audio. El audio muy comprimido o de baja tasa de bits descarta el detalle que el modelo necesita.

Cómo obtener la transcripción más precisa

  1. Graba limpio. Micro cercano, sala silenciosa, una voz cada vez. Esto hace más que cualquier posprocesado.
  2. Usa un archivo sin pérdidas o de alta tasa de bits (wav, o un buen mp3/m4a) en lugar de uno muy comprimido.
  3. Separa a los hablantes donde puedas — ayuda tanto a las palabras como a las etiquetas de hablante. (Más sobre esto en qué es la diarización de hablantes.)
  4. Verifica contra el audio. Trata la transcripción automática como un primer borrador. En ScribeToAny, hacer clic en un segmento reproduce ese momento, la forma más rápida de corregir un nombre o término mal oído.
  5. Corrige primero el vocabulario. Los errores que importan suelen ser nombres y jerga — corrígelos antes que nada.

En resumen

Para audio limpio, la transcripción con IA en 2026 está cerca del nivel humano y devuelve un resultado en minutos en lugar de horas. Para audio caótico es un primer borrador sólido que aún necesita una pasada humana — justo donde querrías invertir el tiempo de revisión de todos modos. El número que hay que vigilar no es un "99 % de precisión" de marketing; es cómo se comporta tu propio audio y con qué facilidad la herramienta te permite corregirlo.

Pruébalo con tu propio archivo con las herramientas de audio a texto, voz a texto o dictado a texto, y juzga la precisión sobre la grabación que realmente tienes.


La precisión es una propiedad del audio tanto como del software. Graba bien, verifica lo que vayas a citar, y una tasa de error de palabra baja se convierte en una transcripción en la que puedes confiar. ¿Prefieres a continuación una introducción a los formatos? Consulta los formatos de archivo de subtítulos y transcripciones explicados.

Footnotes

  1. Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (OpenAI, 2022) — Whisper alcanza aproximadamente un 3 % de WER en LibriSpeech test-clean. https://cdn.openai.com/papers/whisper.pdf ↩

  2. Sobre transcripción humana cuidadosa vs. rápida y el desacuerdo entre transcriptores (~4–4,5 % de WER en habla conversacional), véase p. ej. Stolcke & Droppo, "Comparing Human and Machine Errors in Conversational Speech Transcription" (2017). https://arxiv.org/abs/1708.08615 ↩