Dateiformate für Untertitel und Transkripte erklärt: SRT, VTT, TXT, JSON, CSV und mehr
Dateiformate für Untertitel und Transkripte im Überblick: SRT, VTT, TXT, CSV, JSON, ASS und TTML mit Beispielen und Vergleichstabelle.
Transkribiere eine Datei, und du wirst sofort gefragt, in welchem Format du sie willst. SRT? VTT? TXT? Etwas mit JSON im Namen? Die Formate sind nicht austauschbar — jedes wirft Informationen weg, die die anderen behalten, und das falsche zu wählen bedeutet, den Export zu wiederholen oder einen Konverter zu schreiben.
Dies ist ein Nachschlagewerk zu jedem Format, in dem ein Transkript üblicherweise vorliegt: wie es aussieht, wofür es da ist und wie man zwischen ihnen wechselt.
Die Zusammenfassung in einer Tabelle
| Format | Zeitstempel | Styling | Maschinenlesbar | Am besten für |
|---|---|---|---|---|
| SRT | Ja (pro Einblendung) | Minimal | Teilweise | Untertitel/Captions, nahezu universelle Unterstützung |
| VTT | Ja (pro Einblendung) | Ja (Position, Cues) | Teilweise | Web-Video (<track>), HTML5-Player |
| TXT | Nein | Nein | Nein | Lesen, Zitieren, in ein Dokument einfügen |
| TSV | Ja (Spalten) | Nein | Ja | Tabellen, Skripte, Datenpipelines |
| CSV | Ja (Spalten) | Nein | Ja | Excel/Sheets, Importe |
| JSON | Ja (pro Segment) | Nein | Ja | Programmatische Nutzung, APIs, eigene Apps |
| ASS / SSA | Ja | Ja (umfangreich) | Teilweise | Gestylte/Karaoke-Untertitel, Anime-Fansubs |
| SMI (SAMI) | Ja | Ja (HTML/CSS) | Teilweise | Altes Windows Media |
| TTML | Ja | Ja (umfangreich) | Ja (XML) | Rundfunk, Streaming-Auslieferung |
Der Rest dieses Leitfadens ist das Detail hinter jeder Zeile.
SRT (SubRip)
Die Lingua franca der Untertitel. Fast jeder Player, Editor und jede Plattform akzeptiert .srt. Eine Datei ist eine Liste nummerierter Einblendungen: ein Index, ein Start-und-End-Zeitstempel, eine oder mehrere Textzeilen, dann eine Leerzeile.
1
00:00:00,498 --> 00:00:02,827
Hallo und willkommen zur Sendung.
2
00:00:02,900 --> 00:00:05,110
Heute sprechen wir über Dateiformate.
Beachte das Komma vor den Millisekunden (,498) — das ist SRTs Erkennungszeichen und das, was die meisten handgeschriebenen Konverter falsch machen. Styling beschränkt sich auf einfache Tags. Nutze SRT, wenn du die größtmögliche Kompatibilität willst.
Wandle hinein oder heraus: VTT zu SRT, SRT zu Text, SRT zu Word, SRT zu PDF, oder takte Einblendungen im SRT-Editor um.
VTT (WebVTT)
Das native Untertitelformat des Webs, entworfen für das HTML5-Element <track>. Es sieht aus wie SRT mit drei Unterschieden: ein erforderlicher WEBVTT-Header, ein Punkt vor den Millisekunden (kein Komma) und Unterstützung für Positionierung, Styling und Metadaten der Einblendungen.
WEBVTT
00:00:00.498 --> 00:00:02.827
Hallo und willkommen zur Sendung.
00:00:02.900 --> 00:00:05.110 line:90% align:center
Heute sprechen wir über Dateiformate.
Nutze VTT, wenn das Video in einem Browser oder HTML5-Player läuft. Wenn eine Plattform deine Datei ablehnt, ist der SRT/VTT-Mismatch der übliche Übeltäter — tausche mit SRT zu VTT oder VTT zu Text.
TXT (reiner Text)
Das ganze Transkript als Fließtext, ohne Zeitstempel, ohne Struktur. Das willst du zum Lesen, zum Zitieren in einem Dokument, zum Einfügen in einen Blogbeitrag oder zum Füttern eines anderen Tools, das nur die Wörter braucht. Es ist der menschenfreundlichste Export und der am wenigsten nützliche für alles, was Timing braucht.
TSV und CSV
Tabellarische Transkripte: eine Zeile pro Segment, mit Startzeit, Endzeit und Text als Spalten (TSV trennt sie mit Tabs, CSV mit Kommas).
start end speaker text
0 2827 S1 Hallo und willkommen zur Sendung.
2900 5110 S1 Heute sprechen wir über Dateiformate.
Öffne beide in Excel oder Google Sheets oder lies sie Zeile für Zeile in einem Skript. TSV ist von den beiden das sicherere für Transkripte, weil gesprochener Text voller Kommas ist, die naive CSV-Parser zerbrechen; Tabs tauchen fast nie im Text selbst auf. Greif zu diesen, wenn du analysierst — qualitative Interviews kodieren, Begriffe zählen oder Segmente in eine Pipeline importieren.
JSON
Der strukturierte Export, für den Fall, dass Code der Verbraucher ist. Jedes Segment ist ein Objekt mit seinem Timing, Text und (falls aktiviert) Sprecher, sodass eine Anwendung es lesen kann, ohne Zeitstempel aus einer Zeichenkette zu parsen.
{
"segments": [
{ "start": 0.498, "end": 2.827, "speaker": "S1",
"text": "Hallo und willkommen zur Sendung." },
{ "start": 2.900, "end": 5.110, "speaker": "S1",
"text": "Heute sprechen wir über Dateiformate." }
]
}
Nutze JSON, wenn du auf dem Transkript aufbaust — ein eigener Viewer, ein Suchindex, ein Zusammenfassungsschritt. Es ist die verlustfreie Option: alles, was das Transkript weiß, steckt darin, bereit, in jedes der obigen Formate umgeformt zu werden.
Die gestylten Untertitelformate: ASS, SSA, SMI, TTML
Diese tragen visuelles Styling, das die schlichten Formate nicht können:
- ASS / SSA (Advanced SubStation Alpha) — umfangreiche Positionierung, Schriften, Farben und Karaoke-Timing. Der Standard für Anime-Fansubs und jeden Untertitel, der gestaltet aussehen soll statt Standard. Reduziere auf eine universelle Datei mit ASS zu SRT oder SSA zu SRT.
- SMI (SAMI) — Microsofts älteres, HTML/CSS-basiertes Caption-Format, noch in altem Windows-Media-Inhalt zu finden. Modernisiere es mit SMI zu SRT.
- TTML (Timed Text Markup Language) — ein XML-Format, das in Rundfunk und Streaming-Auslieferung genutzt wird (zu seinen Profilen gehören EBU-TT und die SMPTE-TT/IMSC-Familie). Ausführlich, aber präzise, und Standard in professionellen Pipelines. Wandle mit TTML zu SRT.
Du erstellst selten in diesen, es sei denn, eine Plattform verlangt sie; häufiger bekommst du eines und brauchst es als SRT oder VTT.
Wie man wählt, in je einer Zeile
- Untertitel auf ein Video setzen? SRT für breite Kompatibilität, VTT fürs Web.
- Nur lesen oder zitieren? TXT (oder PDF/DOCX für ein teilbares Dokument).
- Das Transkript analysieren? TSV in eine Tabelle.
- Software darauf bauen? JSON.
- Eine gestylte oder Rundfunk-Datei bekommen? Wandle ASS/SSA/SMI/TTML auf SRT herunter.
Wie man die Datei überhaupt bekommt
All diese kommen aus demselben Schritt: transkribiere das Audio oder Video, dann exportiere. ScribeToAny erzeugt TXT, SRT, VTT, TSV, CSV, JSON, PDF und DOCX aus einem Transkript — erkenne die Sprache automatisch, prüfe die Segmente gegen das Audio und exportiere so viele Formate, wie du brauchst. Wenn du bereits Untertiteldateien hast und nur zwischen Formaten wechseln musst, erledigen die Browser-Tools die Umwandlung auf deinem Rechner, ohne dass etwas hochgeladen wird.
Formate sind nur unterschiedliche Ansichten desselben zeitgesteuerten Textes — Wörter, Timings und manchmal Styling. Wähle das, was dein Ziel erwartet, und behalte ein JSON oder ein VTT als verlustfreie Master-Kopie. Beginne mit dem Audio-zu-Text-Tool und exportiere in das, was als Nächstes kommt.