Kein Konto. 10 Aufnahmen pro Tag. Andere geben Ihnen drei Dateien pro Tag und nennen es unbegrenzt. Dateien bis zu 60 Minuten hier, und es wird um Mitternacht zurückgesetzt.
Mit den Whisper-Plugins für Obsidian können Sie den Server auswählen, mit dem sie kommunizieren. Die meisten Benutzer lassen es auf OpenAI eingestellt und zahlen 0,006 US-Dollar pro Minute, die sie diktieren. Ändern Sie ein Feld in ScribeGrab, und das gleiche Plugin funktioniert weiter – auf meiner Grafikkarte, kostenlos, ohne API-Schlüssel.
In den Plugin-Einstellungen gibt es eine API-URL Feld, ausgefüllt mit https://api.openai.com/v1/audio/transcriptionsErsetzen Sie es durch:
https://scribegrab.com/v1/audio/transcriptions
Das ist die gesamte Konfiguration. Der Endpunkt verwendet die Transkriptions-API von OpenAI – das gleiche Multipart-Formular, die gleiche JSON-Antwort – sodass das Plugin nicht merkt oder sich darum schert, dass es nicht mehr mit OpenAI kommuniziert.
Authorization Header wird akzeptiert und weggeworfen.Feldnamen unten sind von nikdanilov's Whisper PluginDer populäre. Andere Plugins verwenden die gleichen Wörter in einer anderen Reihenfolge.
| Einstellung | Was soll hineingeladen werden? |
|---|---|
| Whisper API-Schlüssel | Leer lassen. Wird ignoriert, auch wenn Sie es ausfüllen. |
| API-URL | https://scribegrab.com/v1/audio/transcriptions |
| Modell | Alles — whisper-1 ist in Ordnung. Jede Anfrage läuft das gleiche Modell, weil das die einzige auf der Karte ist. |
| Sprache | Leer für automatische Erkennung (ca. 100 Sprachen) oder einen Code wie en, nl, de. Das Wort auto auch verstanden wird. |
| Eingabeaufforderung | Akzeptiert und ignoriert. Vokabelhinweise werden hier nicht an das Modell weitergeleitet. |
| Temperatur | Akzeptiert und ignoriert – der Transkriptor verwendet seine eigene Fallback-Liste. |
| Antwortformat | json Das ist es, was Plugins erwarten. text, srt, vtt und verbose_json auch arbeiten. |
Bevor Sie es mit einer echten Aufnahme verwenden, geben Sie eine beliebige Audiodatei über die Befehlszeile ein:
curl https://scribegrab.com/v1/audio/transcriptions \ -F [email protected] \ -F model=whisper-1 {"text":"This is the first sentence of the memo."}
Addition -F response_format=srt für zeitcodierte Untertitel oder verbose_json für eine Segmentliste mit Start- und Endzeiten. Die Anfrage bleibt offen, bis das Transkript existiert, genau wie OpenAIs — Eine zweiminütige Sprachnote kommt normalerweise in wenigen Sekunden zurück.
Dies ist der Computer einer einzelnen Person, nicht eine Cloud-Region. Alles unten ist die gleiche Regel, nach der auch die Website selbst funktioniert, nicht eine spezielle API-Stufe:
verbose_json Das ist die reine Version. Du bekommst id, start, end und text pro Segment. Die interne Statistik des Modells (avg_logprob, tokens, no_speech_prob) sind nicht da — Ich würde lieber ein Feld auslassen, als eine Nummer zu erfinden.Ihr Audio geht zu einer Maschine in meinem Haus, wird transkribiert, und die hochgeladene Datei ist löschte den Moment, in dem das Transkript existiertDas Transkript selbst wird innerhalb von 45 Minuten gelöscht (24 Stunden, wenn Sie einen Monatspass gekauft haben) — Dieses längere Fenster ist Teil dessen, wofür der Pass ist. Nichts wird aufbewahrt, verkauft oder verwendet, um etwas zu trainieren, und Ihre Aufzeichnung wird niemals an OpenAI, Google oder eine andere API weitergeleitet. Der ganze Punkt dieser Website Es zahlt auch nicht pro Minute. Details in der Datenschutzpolitik.
Dennoch: Es ist immer noch mein Computer. Wenn eine Aufnahme so vertraulich ist, dass der Server eines Fremden ein Problem darstellt, führen Sie stattdessen ein Modell lokal aus – dieser Rat kostet mich nichts, und es ist der richtige Rat.
Alles, mit dem Sie eine OpenAI-Basis-URL festlegen können, kann dies verwenden: Diktierstarter, Shell-Skripte, Makefile Das untertitelt Ihre Bildschirmaufnahmen. Wenn Ihr Tool nach einem Basis-URL Anstatt einen vollständigen Endpunkt, geben Sie es https://scribegrab.com/v1 Und es wird den Rest selbst anhängen.
ScribeGrab ist weder mit OpenAI noch mit Obsidian verbunden; „OpenAI-kompatibel“ bedeutet hier, dass es die gleiche Anfrage akzeptiert und eine Antwort in der gleichen Form zurückgibt.
Besprechungsnotizen bereits in Obsidian fallen lassen? Wenn die Quelle eine PDF-Datei anstelle einer Audiodatei ist, ScanReviver PDF zum Markdown Konvertiert es auf die gleiche Weise — Überschriften als Überschriften, bereit für das gleiche Gewölbe.
Schnappte auch ein Foto des Whiteboards während des gleichen Meetings? Whiteboard-Foto von ScanReviver in PDF reinigt es in ein gerades PDF, das Sie in den gleichen Notizenordner legen können.
Die Kosten für die Server sind bereits bezahlt, sodass Ihre Audiodateien mich nur Strom kosten und sonst nichts. Die Werbung auf der Website deckt diese Kosten. Der Haken ist die Warteschlange und die fehlende Garantie für eine hohe Verfügbarkeit – das ist alles, und beides steht oben.
Das ist das Plugin, bevor es überhaupt zu mir gelangt: Die meisten davon weigern sich, Clips zu senden, die kürzer als eine Sekunde sind. Sprechen Sie ein paar Sekunden länger.
Das erste bedeutet, dass die Datei abgeschnitten oder beschädigt ist — Nichts in ihm sagt, wie lange es ist, und ich lehne alles ab, was ich nicht messen kann, anstatt es für immer auf der Karte kauen zu lassen. Browser-Aufnahmen, die die Länge offen lassen (die üblichen) .webm von einem Plugin) sind in Ordnung: Diese werden richtig gemessen. Die zweite bedeutet, dass es wirklich keinen Ton darin gibt, was bei Silent Screen-Aufnahmen passiert.
Nicht durch diesen Endpunkt — Die API von OpenAI hat kein Feld dafür. Die Website tut: Fügen Sie den Link auf Die YouTube Seite.
durch Sam Rider — Ich baue und betreibe ScribeGrab auf meiner eigenen Hardware, auf meiner eigenen. Wer ich bin.