toolsmith

Kein Upload · alles läuft im Browser

Untertitel aus einem Video erzeugen

Hört das Gesprochene in einem Video oder einer Audiodatei ab und schreibt Untertitel mit Zeiten, die Sie als SRT oder VTT laden können. Das Modell wird auf Ihr Gerät geladen und läuft dort — die Datei verlässt diesen Tab nicht.

Video oder Audiodatei hier ablegen

MP4 · MOV · M4A · WAV · MP3 — bis 20 Minuten

Ein Klick lädt rund 150 MB an Laufzeit und Modell herunter. Es wird einmal geladen und von Ihrem Browser behalten — die nächste Datei startet sofort.

Bei verrauschten oder sehr alten Aufnahmen kann das Modell hängen bleiben und Wörter wiederholen. Mit sauberem Ton geht es deutlich besser.

Wohin geht mein Video?

Nirgendwohin. Es wird in diesem Tab geöffnet und nie hochgeladen. Hier wiegt das schwerer als bei den meisten Werkzeugen: Die Aufnahme einer Besprechung oder Vorlesung ist genau die Art Datei, die man nicht dem Server eines Fremden geben sollte.

Warum ist der Download so groß?

Weil nur das Modell in voller Genauigkeit wirklich funktioniert. Wir haben es gemessen: Die 8-Bit-Fassungen öffnen gar nicht erst, und die 16-Bit-Fassungen sind schlimmer als nutzlos — das kompakte Modell zerlegt Sätze, das genaue wiederholt nur noch zwei Wörter. Ein Modell, das laut scheitert, ist in Ordnung; eines, das leise plausiblen Unsinn liefert, nicht. Deshalb liefern wir volle Genauigkeit und nennen die Größe vorher.

Welche Dateien kann ich nehmen?

MP4, MOV, M4A, WAV und MP3. Das sind die Formate, die Ihr Browser allein öffnen kann — wir schicken nie einen weiteren Decoder mit. MP3 kam zuletzt dazu, nicht weil es schwer wäre, sondern weil es **keinen Container hat**: Es ist ein blanker Strom von Frames, und jemand muss die Frame-Grenzen finden, bevor der Decoder des Browsers ihn annimmt. Diesen Teil haben wir geschrieben; heruntergeladen wird nichts zusätzlich.

Das Ergebnis wiederholt dieselben Wörter.

Das ist das Modell, das an verrauschtem Ton scheitert, und es ist die ehrliche Grenze dieses Werkzeugs. Gemessen an einer Redeaufnahme von 1948: Das kompakte Modell lieferte nur eine wiederholte Silbe. Dasselbe Modell war bei sauberem, modernem Ton genau — es liegt an der Aufnahmequalität, nicht an der Sprache. Wenn Ihre Quelle leise ist, hallt oder Musik über der Stimme liegt, rechnen Sie damit.

Welches Modell soll ich nehmen?

Fangen Sie mit dem kompakten an. Bei einem sauberen 16-Sekunden-Clip auf Koreanisch machte es zwei Fehler in rund vierzig Wörtern, das genaue einen. Das genaue Modell lohnt seine Größe bei einer langen Aufnahme, die Sie veröffentlichen, und lohnt sie nicht für eine grobe Mitschrift. Beachten Sie außerdem: Das genaue Modell braucht selbst auf der Grafikkarte etwa zwanzig Sekunden Anlauf.

Was ist der Unterschied zwischen SRT und VTT?

SRT erwarten die meisten Schnittprogramme und Player. VTT ist der Webstandard, den das HTML-video-Element nutzt. Hier tragen beide dasselbe, nehmen Sie also das, was Ihr nächster Schritt möchte. Die reine Textdatei hat gar keine Zeiten — nützlich, wenn Sie nur die Wörter wollen.

Weitere Werkzeuge

Lesenswert