SCRIBEGRAB

Wandeln Sie jedes Audio oder Video in Text und Untertitel um

Kostenlos, ohne Registrierung, ohne Wasserzeichen. Eine Stunde Audio dauert etwa zwei Minuten.

Keine Datei zur Hand? Fügen Sie einen YouTube-Link unten ein. Untertitel können in 16 Sprachen übersetzt werden.

oder fügen Sie einen Link ein
Hochladen…

Fügen Sie einen YouTube-Link ein und schon erhalten Sie das Ergebnis – und selbst wenn das Video keine Untertitel hat, erstellen wir diese trotzdem, was die meisten anderen Tools nicht können. Interviews, Vorlesungen, Podcasts, Sprachnotizen: Dateien bis zu 60 Minuten Länge, keine Registrierung erforderlich, kein Wasserzeichen.

Von der Aufnahme zum Transkript

1. Ziehen Sie eine Datei hierher

Beliebiges gängiges Audio- oder Videoformat. Die Transkription beginnt sofort: keine Registrierung, keine E-Mail-Adresse erforderlich, keine tägliche Begrenzung.

2. Das Tool erstellt das Transkript

Ein Spracherkennungsmodell transkribiert den Inhalt auf unserer GPU, erkennt die Sprache automatisch und kennzeichnet, wer spricht, wenn mehr als eine Stimme vorhanden ist – in der Regel deutlich schneller als in Echtzeit.

3. Herunterladen

Erhalten Sie das reine Transkript als TXT-Datei und zeitgesteuerte Untertitel als SRT- und VTT-Dateien. Ihre hochgeladene Datei wird automatisch gelöscht.

17 Sekunden, nichts gekürzt: eine Aufnahme wird eingegeben und als Transkript mit TXT-, SRT- und VTT-Dateien ausgegeben, die zum Herunterladen bereit sind.
AUDIO transkribieren transcript.txt 00:00 Willkommen zurück auf dem Kanal. 00:04 Heute testen wir drei günstige Mikrofone.
Sprache rein, saubere, mit Zeitstempeln versehene Textausgabe: Das Transkript speichert für jede Zeile einen Zeitstempel.

Drei Arten von Aufnahmen

FÜR ENTWICKLER

Video-Untertitel

SRT/VTT-Untertitel für YouTube, Reels und TikTok: Barrierefreiheit und größere Reichweite, ohne pro Minute zu bezahlen.

FÜR ARBEIT UND LERNEN

Interviews & Vorlesungen

Wandeln Sie aufgezeichnete Interviews, Besprechungen und Vorlesungen in durchsuchbaren Text um, den Sie zitieren und überfliegen können. Die Aufnahmen werden nach Sprechern aufgeteilt, sodass Sie sehen können, wer was gesagt hat.

FÜR PODCASTS

Shownotes

Eine vollständige Transkription pro Episode für Shownotes und SEO: jedes Wort Ihrer Episode wird indexierbar wiedergegeben.

Fragen zur Transkription

Ist es wirklich kostenlos?

Ja: keine Registrierung erforderlich, kein Wasserzeichen, keine Gebühren pro Minute oder tägliche Begrenzung, und das kostenlose Tool ist keine Testversion – es läuft nicht ab und verwendet dasselbe Modell wie alle anderen Tools hier. Werbung finanziert den Betrieb der GPU. Es gibt eine optionale Zusatzfunktion: ein Monatsabonnement für 5 € mit Meeting-Notizen, echten Sprechernamen, Word-Export und höheren Limits. Damit können Sie mehr mit Ihrer Transkription machen, aber nicht eine bessere Transkription erstellen.

Was passiert mit meiner Datei?

Sie wird auf unserem eigenen Server verarbeitet und sofort nach der Bearbeitung gelöscht; die Ergebnisse werden innerhalb von 45 Minuten gelöscht. Nichts wird gespeichert, weitergegeben oder für Trainingszwecke verwendet. Weitere Informationen finden Sie in den Datenschutzbestimmungen.

Wie genau ist es?

Wir verwenden our speech model, eines der besten Open-Source-Modelle zur Spracherkennung. Deutliche Sprache wird sehr präzise transkribiert; starke Akzente, Überlagerungen, Hintergrundgeräusche oder schlechte Aufnahmen stellen für jedes Tool eine größere Herausforderung dar. Führen Sie immer eine kurze Korrekturlesung durch.

Zeigt es an, wer spricht?

Ja. Wenn mehr als eine Stimme erkannt wird, teilt das Tool die Transkription automatisch in Sprecherabschnitte auf, bis zu acht Sprechern, ohne dass etwas aktiviert werden muss. Das macht eine Interview- oder Meeting-Aufnahme lesbar, anstatt einen langen Textblock darzustellen. Die Bezeichnungen werden von der KI geschätzt, daher sollten Sie bei Überlagerungen oder sehr ähnlichen Stimmen diese kurz überprüfen.

Kann das Tool Schimpfwörter ausblenden?

Ja. Aktivieren Sie vor dem Hochladen die Option „Auch eine bereinigte oder untertitelte Version erstellen“, und Sie erhalten eine zweite Datei zurück, in der jedes Schimpfwort ausgeblendet, stummgeschaltet oder entfernt wurde – Außerdem können Sie bei Bedarf auch Füllwörter und lange Pausen entfernen. Zuerst sehen Sie die vollständige Liste mit Zeitangaben und können beliebige Wörter beibehalten. Mehr dazu unter Schimpfwörter ausblenden und Füllwörter entfernen.

Welche Sprachen und Dateiformate werden unterstützt?

Rund 100 Sprachen, automatisch erkannt (oder Sie wählen eine Sprache selbst). Audio- und Videodateien: MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM und mehr, bis zu 1.5 GB und 60 Minuten.

Kann ich Untertitel für ein Video erstellen?

Ja, laden Sie das Video direkt hoch und laden Sie die SRT- oder VTT-Datei herunter. Fügen Sie die SRT-Datei neben Ihrem Video hinzu oder laden Sie sie als Untertitel auf YouTube hoch.

Können die Untertitel direkt in das Video eingebettet werden?

Ja. Instagram, TikTok, WhatsApp und die meisten Fernseher ignorieren eine separate Untertitelfile. Aktivieren Sie daher vor dem Hochladen die Option „Auch eine bereinigte oder untertitelte Version erstellen“, wählen Sie eines von drei Designs (Klassisch, Rahmen oder Groß) aus und laden Sie eine MP4-Datei mit dem in das Bild gebrannten Text herunterKeine Installation einer zusätzlichen Software erforderlich, kein Wasserzeichen und Ihre Originaldatei bleibt unverändert. Vollständige Anleitung: So fügen Sie Untertitel zu jedem Video hinzu.

Möchten Sie stattdessen ein Lied in einzelne Spuren aufteilen?

Das ist unser Schwestertool: StemGrab Es trennt Gesang, Schlagzeug, Bass und Instrumentalteile – und das alles kostenlos.

Wo genau nimmt die Genauigkeit ab?

Bei einer klaren Aufnahme von einer Person, die Englisch spricht, erzielt das Modell etwa 98 von 100 Wörtern korrekt – wir haben bei sauberer Sprache eine Fehlerrate von 1,94 % gemessen. Drei Dinge beeinträchtigen das Ergebnis am stärksten: Überlagerungen, wenn zwei Personen gleichzeitig sprechen, da das Modell sich für eine entscheiden muss. Die Entfernung zum Mikrofon, da ein Telefon auf der anderen Seite eines Konferenztisches mehr Raumgeräusche als Stimme aufnimmt. Und ungewöhnlicher Wortschatz: Namen, Marken, Fachjargon und Abkürzungen werden aus dem Kontext abgeleitet, sodass ein Nachname, den das Modell noch nie gesehen hat, zu etwas wird, das nur ähnlich klingt. Starke Akzente werden besser verarbeitet, als die meisten Leute erwarten; Hintergrundmusik wird schlechter verarbeitet.

Warum gibt es keine tägliche Begrenzung, obwohl andere kostenlose Transkriptionsdienste eine solche haben?

Die Spracherkennung erfordert GPU-Rechenzeit, und die meisten kostenlosen Transkriptionsdienste mieten diese Zeit von einem Cloud-Dienst pro Audio-Minute – genau das ist der Grund für die Begrenzung auf drei Dateien pro Tag und zwanzig Minuten. Wir besitzen die Hardware: Die gleichen Grafikkarten betreiben unsere anderen Tools in den Niederlanden, sodass eine zusätzliche Aufnahme Strom kostet, anstatt eine Rechnung auszulösen, und die Werbung auf der Seite deckt diese Kosten. Deshalb können die Dateien bis zu neunzig Minuten lang sein und jeweils zwei Gigabyte groß, und zwar so viele, wie Sie möchten, ohne ein Konto oder eine E-Mail-Adresse anzugeben.

Beliebte Anwendungsbereiche für ScribeGrab