SCRIBEGRABÖffnen Sie das Tool →

SRT vs. VTT: Welches Untertitelformat benötigen Sie?

Keine Registrierung erforderlich. Keine tägliche Begrenzung.Andere Anbieter bieten Ihnen drei Dateien pro Tag an und nennen es „unbegrenzt“. Hier können Sie so viele Dateien verarbeiten, wie Sie möchten, bis zu einer Länge von 60 Minuten.

Sie sehen fast identisch aus, beide sind reiner Text, und dennoch führt das Hochladen des falschen Formats auf einigen Plattformen immer noch zu Fehlern. Hier erfahren Sie genau, wie sich SRT und WebVTT unterscheiden, anhand von realen Beispielen, und welches Format die einzelnen Plattformen tatsächlich benötigen.

Die 30-Sekunden-Antwort

SRT (SubRip) ist der alte, universelle Standard: denkbar einfach und wird von fast allen Videobearbeitungsprogrammen, Mediaplayern und Upload-Plattformen unterstützt. VTT (WebVTT, „Web Video Text Tracks“) ist der offizielle Webstandard: Er wird vom HTML5-Element benötigt und bietet zusätzliche Formatierungs- und Positionierungsfunktionen, die SRT nicht hat. Als Faustregel gilt <track> Hochladen auf eine Plattform oder Importieren in ein Bearbeitungsprogramm → SRT; Einbetten auf Ihrer eigenen Website → VTT. Wenn Sie sich unsicher sind, behalten Sie beide Formate bei: When in doubt, keep both: Mit ScribeGrab erhalten Sie beide Dateitypen aus einem einzigen UploadSo müssen Sie sich nie mehr entscheiden.

Benötigen Sie beides? ScribeGrab liefert Ihnen immer SRT- und VTT-Dateien (sowie eine einfache Textdatei) aus einem einzigen Upload. Einmal hochladen, alle Formate erhalten →

Wie die Formate tatsächlich aussehen

SRT-Beispiel

1
00:00:01,000 --> 00:00:04,200
Welcome back to the channel.

2
00:00:04,400 --> 00:00:07,900
Today we're testing three budget microphones.

Jede Zeile besteht aus: einer fortlaufenden Nummer, einer Zeitcodezeile mit einem Komma vor den Millisekunden, ein oder mehreren Textzeilen und einer Leerzeile. Das ist das gesamte Format.

VTT-Beispiel

WEBVTT

00:00:01.000 --> 00:00:04.200
Welcome back to the channel.

00:00:04.400 --> 00:00:07.900 line:85% align:center
Today we're testing three budget microphones.

Drei sichtbare Unterschiede: der obligatorische WEBVTT Header in der ersten Zeile, ein Punkt anstelle eines Kommas vor den Millisekunden und optionale Cue-Einstellungen nach dem Zeitcode (Position, Ausrichtung, Zeilenplatzierung). Cuenummern sind in VTT optional. VTT unterstützt außerdem NOTE Kommentarblöcke STYLE mit CSS formatieren und Inline-Tags wie <b>, <i> und Sprach-Tags (<v Anna>) für Sprecherkennzeichnungen verwenden.

SRT SubRip · .srt 1 ← Cue-Nummer 00:00:01,000 --> 00:00:04,200 Willkommen zurück auf dem Kanal. 2 00:00:04,400 --> 00:00:07,900 Wir testen drei Mikrofone. VTT WebVTT · .vtt WEBVTT ← erforderlicher Header 00:00:01.000 --> 00:00:04.200 Willkommen zurück auf dem Kanal. 00:00:04.400 --> 00:00:07.900 Wir testen drei Mikrofone. Cue-Nummern sind nicht erforderlich
Gleicher Text und gleiche Zeitangaben: Die Unterschiede liegen in den WEBVTT Kopfzeile, Zeilenumbrüche und ein Komma (SRT) im Vergleich zu einem Punkt (VTT) vor den Millisekunden.

Die wichtigen Unterschiede

SRTVTT
KopfzeileNicht erforderlichWEBVTT in Zeile 1 erforderlich
Trennzeichen für MillisekundenKomma (00:00:01,000)Punkt (00:00:01.000)
ZeilenumbrücheErforderlichOptional
FormatierungAllenfalls grundlegende Tags; oft werden diese entferntCSS über STYLE Blöcke, Inline-Tags, Klassen pro Cue
PositionierungNeinJa (line, position, align Einstellungen)
HTML5 <track>Wird von Browsern nicht unterstütztDas erforderliche Format
KodierungHistorisch gesehen unübersichtlich (alte ANSI-Dateien)Immer UTF-8

Die Unterscheidung zwischen Komma und Punkt ist ein klassischer Stolperstein: Wenn Sie SRT-Zeitcodes in eine VTT-Datei einfügen (oder umgekehrt), lehnen strenge Parser die gesamte Datei ab.

Welche Plattformen unterstützen welche Formate

VTT im Web verwenden

Hier treffen Sie die Entscheidung ganz einfach. Untertitel in einem HTML5-Video sehen wie folgt aus:

<video controls src="/talk.mp4">
  <track kind="captions" src="/talk.vtt"
         srclang="en" label="English" default>
</video>

Der Browser rendert die Zeitmarken nativ, Zuschauer können sie ein- und ausschalten, und da der Text echter Text ist (und nicht in Pixeln eingebettet), ist er zugänglich und durchsuchbar. Eine vollständige Anleitung für jede Plattform finden Sie unter So fügen Sie jedem Video Untertitel hinzu.

Was sollten Sie also generieren?

Idealerweise beides: Sie enthalten identischen Text und Zeitangaben, sodass es keinen Qualitätsverlust gibt, sondern nur eine Frage der Kompatibilität. Jede Transkription auf ScribeGrab erzeugt die TXT-Transkription sowie sowohl SRT als auch VTT aus einem einzigen Upload, kostenlos und ohne tägliches Limit. Laden Sie Ihr Audio oder Video einmal hoch und behalten Sie die Datei, die jede Plattform benötigt. Und wenn Sie sich fragen, wie genau das automatische Transkript dem tatsächlichen Gesagten entspricht, lesen Sie unsere ehrliche Analyse von der Genauigkeit der Transkription.

SRT + VTT kostenlos generieren →

FAQ

Was ist der Unterschied zwischen SRT und VTT?

SRT ist das ältere, einfachere Format: nummerierte Zeitmarken mit durch Kommas getrennten Millisekunden. VTT ist der Webstandard: eine WEBVTT Kopfzeile, durch Punkte getrennte Millisekunden, optionale Zeitmarkennummern sowie Styling- und Positionierungsfunktionen, die SRT nicht bietet.

Sollte ich SRT oder VTT für YouTube verwenden?

YouTube akzeptiert beide Formate, daher funktionieren beide. SRT ist die sicherste Wahl für Upload-Plattformen; VTT wird benötigt, wenn Sie Untertitel in Ihren eigenen HTML5-Player einbetten möchten.

Kann ich SRT in VTT konvertieren?

Ja, fügen Sie eine WEBVTT erste Zeile hinzu und ändern Sie das Komma vor den Millisekunden in einen Punkt. Oder überspringen Sie die Konvertierung vollständig: ScribeGrab gibt beide Formate mit jeder Transkription aus.

Welches Format bevorzugen Videobearbeitungsprogramme?

Premiere Pro, DaVinci Resolve und Final Cut Pro importieren SRT direkt. SRT ist der De-facto-Standard in der Desktop-Bearbeitung.