toolsmith

Kein Upload · alles läuft im Browser

SRT oder VTT — welche Untertiteldatei brauchen Sie?

Öffnen Sie beide in einem Texteditor, und Sie werden Mühe haben, sie auseinanderzuhalten. Die Unterschiede sind winzig, aber einer davon entscheidet, ob eine Webseite Ihre Untertitel überhaupt abspielt.

Aktualisiert

Beides ist reiner Text mit Zeitmarken

Eine SRT-Datei ist eine nummerierte Liste von Blöcken. Jeder Block hat einen Index, eine Start- und Endzeit wie `00:00:01,000 --> 00:00:04,000` und die anzuzeigenden Zeilen. Das ist das ganze Format. Diese Schlichtheit erklärt, warum es überall auftaucht — Mediaplayer, Fernseher, Schnittprogramme, Videoplattformen.

VTT ist dieselbe Idee, für das Web neu geschrieben. Es wurde standardisiert, damit Browser Untertitel direkt an einem HTML-Videoelement anzeigen können, und schafft Platz für Dinge, für die SRT nie eine Stelle hatte.

Die Unterschiede, vollständig

Es sind nicht viele, und alle sind rein mechanisch:

  • Eine VTT-Datei muss mit der Zeile `WEBVTT` beginnen. Fehlt sie, weist der Browser die ganze Datei ab — der mit Abstand häufigste Grund, warum Untertitel wortlos ausbleiben.
  • Sekundenbruchteile trennt SRT mit Komma, VTT mit Punkt.
  • SRT verlangt die Blocknummern. VTT behandelt sie als optionale Bezeichner.
  • VTT kann Position, Ausrichtung, Gestaltung und Sprecherkennzeichnung mitführen. SRT kennt davon nichts.
  • Das `<track>`-Element von HTML5-Video akzeptiert nur VTT. Ein SRT lädt es nicht.

Was Sie also nehmen sollten

Läuft das Video auf einer Webseite, die Sie kontrollieren: VTT — eine Wahl haben Sie nicht. Für alles andere ist SRT die sicherere Datei: Desktop-Player, Telefone, Fernseher, Schnittprogramme und jede große Videoplattform nehmen sie an, und einige davon nehmen kein VTT.

Weil die Umwandlung rein mechanisch ist, lohnt das Grübeln nicht. Unser Untertitelwerkzeug schreibt beide Dateien aus derselben Transkription, nehmen Sie also die, die das Ziel verlangt.

Wie automatische Untertitel entstehen — und wie sie scheitern

Erzeugte Untertitel kommen aus einem Spracherkennungsmodell. Der Ton wird dekodiert, auf 16 kHz gebracht und an das Modell übergeben, das Text samt Start- und Endzeit jedes Abschnitts zurückgibt. Hier passiert das im Browser-Tab, das Modell muss also zuerst geladen werden — 151 MB oder 291 MB, je nach Wahl. Deshalb nennt das Werkzeug die Zahl vorher und nicht hinterher.

Die Fehlerart, die man kennen sollte: Schlechter Ton ergibt nicht etwas schlechteren Text, sondern eine Schleife. Wir gaben ihm eine Redeaufnahme von 1948, und es gab immer wieder dieselbe Silbe zurück. Eine saubere moderne Aufnahme derselben Sprache ergab rund vierzig Wörter mit zwei Fehlern. Das war Aufnahmequalität, nicht Sprachschwierigkeit — und weil es der Fehler ist, dem die meisten begegnen werden, steht er als dauerhafter Hinweis auf der Seite und nicht versteckt in einer FAQ.

Der teuerste Fehler ist allerdings die Sprachauswahl. Richten Sie ein Erkennungsmodell auf die falsche Sprache, hört es nicht auf; es erzeugt flüssigen, selbstbewussten Unsinn — wir haben eine englische Aufnahme gemessen, die als hundertzwanzig Zeilen koreanisches Kauderwelsch transkribiert wurde. Liest sich die Transkription wie plausibler Text, der nichts mit dem Ton zu tun hat, prüfen Sie zuerst das.

Übersetzen ist eine eigene Aufgabe

Für die Übersetzung läuft wieder ein anderes Modell: ein mehrsprachiges mit 418 Millionen Parametern, das hundert Sprachen in jede Richtung beherrscht. Es ist klein genug für einen Tab, und diese Größe legt die Qualität fest.

Die ehrliche Beschreibung: Von zwanzig Zeilen kommen etwa fünfzehn gut heraus, fünf sind holprig, aber verständlich. Gewöhnliche Sätze gelingen. Bei Redewendungen rutscht es ab — «let's wrap this up» («lassen Sie uns zum Schluss kommen») kam auf Spanisch wie auf Deutsch ungefähr als «fangen wir an» heraus, und das ist kein kleiner Fehler.

Sehr kurze Ausrufe sind der eine Fall, in dem es nicht bloß abrutscht, sondern in Wiederholung zusammenbricht. Statt das auszuliefern, erkennt das Werkzeug den Zusammenbruch und lässt die Originalzeile unübersetzt stehen, damit Sie sehen, welche Zeilen einen Menschen brauchen.

Jetzt erledigen — ohne Upload

Kann ich eine .srt einfach in .vtt umbenennen?

Nein. Ihr fehlt die Kopfzeile `WEBVTT`, und ihre Zeitmarken verwenden Kommas, wo VTT Punkte erwartet. Ein Browser weist sie rundweg ab. Die Umwandlung ist einfach, aber sie ist kein Umbenennen.

Werden die Untertitel ins Video eingebrannt?

Nein — die Untertiteldatei liegt neben dem Video, und der Player zeichnet sie. Das ist die bessere Anordnung: Zuschauer können sie abschalten, Sie können einen Tippfehler ohne Neukodierung beheben, und dasselbe Video kann mehrere Sprachen führen.

Der Text ist flüssig, hat aber nichts mit dem Ton zu tun.

Die Sprache ist falsch eingestellt. Ein Sprachmodell, das nach der falschen Sprache gefragt wird, scheitert nicht — es erzeugt selbstbewusst wohlgeformten Text in dieser Sprache. Stellen Sie die gesprochene Sprache ein und lassen Sie es erneut laufen.

Lesenswert