Formatos de archivo de subtítulos y transcripciones explicados: SRT, VTT, TXT, JSON, CSV y más
Guía de formatos de subtítulos y transcripción: SRT, VTT, TXT, CSV, JSON, ASS y TTML con ejemplos y tabla comparativa de uso recomendado.
Transcribe un archivo y enseguida te preguntan en qué formato lo quieres. ¿SRT? ¿VTT? ¿TXT? ¿Algo con JSON en el nombre? Los formatos no son intercambiables — cada uno descarta información que los otros conservan, y elegir el equivocado significa rehacer la exportación o escribir un conversor.
Esta es una referencia de todos los formatos en los que suele venir una transcripción: qué aspecto tienen, para qué sirven y cómo pasar de uno a otro.
El resumen en una tabla
| Formato | Marcas de tiempo | Estilo | Legible por máquina | Ideal para |
|---|---|---|---|---|
| SRT | Sí (por línea) | Mínimo | Parcial | Subtítulos/captions, compatibilidad casi universal |
| VTT | Sí (por línea) | Sí (posición, señales) | Parcial | Vídeo web (<track>), reproductores HTML5 |
| TXT | No | No | No | Leer, citar, pegar en un documento |
| TSV | Sí (columnas) | No | Sí | Hojas de cálculo, scripts, pipelines de datos |
| CSV | Sí (columnas) | No | Sí | Excel/Sheets, importaciones |
| JSON | Sí (por segmento) | No | Sí | Uso programático, APIs, apps a medida |
| ASS / SSA | Sí | Sí (avanzado) | Parcial | Subtítulos con estilo/karaoke, fansubs de anime |
| SMI (SAMI) | Sí | Sí (HTML/CSS) | Parcial | Windows Media heredado |
| TTML | Sí | Sí (avanzado) | Sí (XML) | Radiodifusión, entrega por streaming |
El resto de esta guía es el detalle detrás de cada fila.
SRT (SubRip)
La lengua franca de los subtítulos. Casi todos los reproductores, editores y plataformas aceptan .srt. Un archivo es una lista de señales numeradas: un índice, una marca de tiempo de inicio y fin, una o varias líneas de texto y luego una línea en blanco.
1
00:00:00,498 --> 00:00:02,827
Hola, y bienvenidos al programa.
2
00:00:02,900 --> 00:00:05,110
Hoy hablamos de formatos de archivo.
Fíjate en la coma antes de los milisegundos (,498) — esa es la firma de SRT y lo que la mayoría de conversores hechos a mano equivocan. El estilo se limita a etiquetas básicas. Usa SRT cuando quieras la mayor compatibilidad posible.
Convierte hacia o desde él: VTT a SRT, SRT a texto, SRT a Word, SRT a PDF, o reajusta las marcas de tiempo en el editor de SRT.
VTT (WebVTT)
El formato de subtítulos nativo de la web, diseñado para el elemento HTML5 <track>. Se parece a SRT con tres diferencias: una cabecera WEBVTT obligatoria, un punto antes de los milisegundos (no una coma) y soporte para posicionamiento, estilo y metadatos de las señales.
WEBVTT
00:00:00.498 --> 00:00:02.827
Hola, y bienvenidos al programa.
00:00:02.900 --> 00:00:05.110 line:90% align:center
Hoy hablamos de formatos de archivo.
Usa VTT cuando el vídeo se reproduce en un navegador o un reproductor HTML5. Si una plataforma rechaza tu archivo, el desajuste SRT/VTT es el sospechoso habitual — cámbialo con SRT a VTT o VTT a texto.
TXT (texto plano)
Toda la transcripción como prosa, sin marcas de tiempo, sin estructura. Es lo que quieres para leer, citar en un documento, pegar en una entrada de blog o alimentar a otra herramienta que solo necesita las palabras. Es la exportación más amable para el humano y la menos útil para cualquier cosa que necesite tiempos.
TSV y CSV
Transcripciones tabulares: una fila por segmento, con hora de inicio, hora de fin y texto como columnas (TSV las separa con tabulaciones, CSV con comas).
start end speaker text
0 2827 S1 Hola, y bienvenidos al programa.
2900 5110 S1 Hoy hablamos de formatos de archivo.
Ábrelos en Excel o Google Sheets, o léelos línea a línea en un script. TSV es el más seguro de los dos para transcripciones, porque el texto hablado está lleno de comas que rompen los parsers de CSV ingenuos; las tabulaciones casi nunca aparecen dentro del propio texto. Recurre a ellos cuando estés haciendo análisis — codificar entrevistas cualitativas, contar términos o importar segmentos a un pipeline.
JSON
La exportación estructurada, para cuando el consumidor es código. Cada segmento es un objeto con su tiempo, su texto y (si está activado) el hablante, de modo que una aplicación puede leerlo sin extraer las marcas de tiempo de una cadena.
{
"segments": [
{ "start": 0.498, "end": 2.827, "speaker": "S1",
"text": "Hola, y bienvenidos al programa." },
{ "start": 2.900, "end": 5.110, "speaker": "S1",
"text": "Hoy hablamos de formatos de archivo." }
]
}
Usa JSON cuando estés construyendo sobre la transcripción — un visor a medida, un índice de búsqueda, un paso de resumen. Es la opción sin pérdidas: todo lo que la transcripción sabe está ahí, listo para remodelar a cualquiera de los formatos anteriores.
Los formatos de subtítulos con estilo: ASS, SSA, SMI, TTML
Estos llevan un estilo visual que los formatos planos no pueden:
- ASS / SSA (Advanced SubStation Alpha) — posicionamiento avanzado, fuentes, colores y tiempos estilo karaoke. El estándar para los fansubs de anime y cualquier subtítulo que necesite parecer diseñado en lugar de predeterminado. Redúcelo a un archivo universal con ASS a SRT o SSA a SRT.
- SMI (SAMI) — el formato de captions más antiguo de Microsoft, basado en HTML/CSS, que aún se encuentra en contenido heredado de Windows Media. Modernízalo con SMI a SRT.
- TTML (Timed Text Markup Language) — un formato XML usado en radiodifusión y entrega por streaming (sus perfiles incluyen EBU-TT y la familia SMPTE-TT/IMSC). Verboso pero preciso, y estándar en los pipelines profesionales. Conviértelo con TTML a SRT.
Rara vez creas en estos salvo que una plataforma los exija; lo más frecuente es que recibas uno y lo necesites como SRT o VTT.
Cómo elegir, en una línea cada uno
- ¿Poner subtítulos en un vídeo? SRT para amplia compatibilidad, VTT para la web.
- ¿Solo leerlo o citarlo? TXT (o PDF/DOCX para un documento que puedas compartir).
- ¿Analizar la transcripción? TSV en una hoja de cálculo.
- ¿Construir software sobre ella? JSON.
- ¿Te entregan un archivo con estilo o de radiodifusión? Convierte ASS/SSA/SMI/TTML a SRT.
Conseguir el archivo, para empezar
Todos salen del mismo paso: transcribe el audio o el vídeo y luego exporta. ScribeToAny produce TXT, SRT, VTT, TSV, CSV, JSON, PDF y DOCX a partir de una sola transcripción — detecta el idioma automáticamente, revisa los segmentos contra el audio y exporta tantos formatos como necesites. Si ya tienes archivos de subtítulos y solo necesitas pasar de un formato a otro, las herramientas del navegador hacen la conversión en tu equipo, sin subir nada.
Los formatos son solo vistas distintas del mismo texto sincronizado — palabras, tiempos y, a veces, estilo. Elige el que espera tu destino y guarda un JSON o un VTT como copia maestra sin pérdidas. Empieza con la herramienta de audio a texto y exporta a lo que venga después.