Sin cuenta. 10 grabaciones al día. Otros le dan tres archivos al día y lo llaman ilimitado. Archivos de hasta 60 minutos aquí, y se reinicia a medianoche.
Los complementos de Whisper para Obsidian le permiten elegir el servidor con el que se conectan. La mayoría de las personas lo dejan configurado en OpenAI y pagan $0.006 por cada minuto que dictan. Cambie un campo a ScribeGrab y el mismo complemento seguirá funcionando, en mi tarjeta gráfica, de forma gratuita y sin necesidad de una clave API.
En la configuración del plugin hay un URL de la API caja, llena de https://api.openai.com/v1/audio/transcriptionsReemplazarlo con:
https://scribegrab.com/v1/audio/transcriptions
Esa es toda la configuración. El punto final utiliza la API de transcripción de OpenAI, el mismo formulario multipart y el mismo JSON de respuesta, por lo que el complemento no sabe ni le importa que ya no se esté comunicando con OpenAI.
Authorization el encabezado es aceptado y tirado.Los nombres de campo a continuación son de plugin de nikdanilov Whisper, el popular. Otros plugins usan las mismas palabras en un orden diferente.
| Configuración | Qué incluir |
|---|---|
| Clave de la API de Whisper | Déjelo en blanco. Se ignorará si lo completa de todos modos. |
| URL de la API | https://scribegrab.com/v1/audio/transcriptions |
| Modelo | Cualquier cosa... whisper-1 Está bien. Cada solicitud funciona el mismo modelo, porque ese es el único en la tarjeta. |
| Idioma | Vacío para auto-detecto (cerca de 100 idiomas), o un código como en, nl, de. La palabra auto se entiende también. |
| Indicación | Se acepta e ignora. Las sugerencias de vocabulario no llegan al modelo aquí. |
| Temperatura | Se acepta e ignora; el transcriptor utiliza su propia escala de respaldo. |
| Formato de respuesta | json es lo que esperan los plugins. text, srt, vtt y verbose_json también trabajo. |
Antes de confiar en él con una grabación real, envíale cualquier archivo de audio desde una terminal:
curl https://scribegrab.com/v1/audio/transcriptions \ -F [email protected] \ -F model=whisper-1 {"text":"This is the first sentence of the memo."}
Añadir -F response_format=srt para subtítulos codificados por el tiempo, o verbose_json para una lista de segmentos con tiempos de inicio y final. La solicitud permanece abierta hasta que exista la transcripción, exactamente como la de OpenAI — Una nota de voz de dos minutos suele volver en unos segundos.
Esto es la computadora de una sola persona, no una región en la nube. Todo lo que se indica a continuación sigue la misma regla que utiliza el propio sitio web, no una capa de API especial:
verbose_json es la versión sencilla. Tienes razón. id, start, end y text por segmento. Estadísticas internas del modelo (avg_logprob, tokens, no_speech_prob) no están allí — Prefiero dejar un campo fuera que inventar un número.Tu audio va a una máquina en mi casa, se transcribe, y el archivo subido es borrado el momento en que existe la transcripción. La transcripción en sí se limpia en 45 minutos (24 horas si compraste un pase de mes — que ventana más larga es parte de lo que el pase es para). Nada se mantiene, vende o se utiliza para entrenar cualquier cosa, y su grabación nunca se envía a OpenAI, Google o cualquier otra API — todo el punto de este sitio es que tampoco paga por minuto. Detalles en Política de privacidad.
Dicho esto: sigue siendo mi máquina. Si una grabación es lo suficientemente confidencial como para que el servidor de un desconocido sea un problema, ejecuta un modelo localmente; este consejo no me cuesta nada y es el consejo correcto.
Cualquier cosa que te permita establecer una URL base de OpenAI puede usar esto: lanzadores de dictados, scripts de shell, a Makefile que subtitúa tus grabaciones de pantalla. Si su herramienta pide un URL en lugar de un punto final completo, darle https://scribegrab.com/v1 y anexará el resto en sí.
ScribeGrab no está afiliado con OpenAI ni con Obsidian; "compatible con OpenAI" significa que acepta la misma solicitud y devuelve el mismo tipo de respuesta.
¿Ya deja notas de reunión en Obsidian? Si la fuente es un PDF en lugar de un archivo de audio, PDF de ScanReviver a Markdown lo convierte de la misma manera — rumbos guardados como partidas, listos para la misma bóveda.
También se rompió una foto de la pizarra durante esa misma reunión? ScanReviver foto de pizarra blanca en PDF lo limpia en un PDF recto que puede caer en la misma carpeta de notas.
Las tarjetas ya están compradas y pagadas, por lo que tu audio me cuesta electricidad y nada más. Los anuncios en el sitio web cubren eso. El truco es la cola y la falta de garantía de tiempo de actividad, eso es todo, y ambos están explicados arriba.
Ese es el complemento, antes de que llegue a mí: la mayoría se niegan a enviar clips de menos de un segundo. Habla durante unos segundos más.
El primero significa que el archivo está truncado o corrupto — nada en ella dice cuánto tiempo es, y rehúso cualquier cosa que no pueda medir en lugar de dejar que mastique en la tarjeta para siempre. Grabaciones del navegador que dejan la longitud abierta (la habitual .webm de un plugin) están bien: los que se miden correctamente. El segundo significa que realmente no hay sonido en él, que sucede con grabaciones de pantalla silenciosa.
No por este punto final — La API de OpenAI no tiene campo para ello. El sitio web hace: pegar el enlace en la página YouTube.
Por Sam Ridder —Construyo y ejecuto ScribeGrab en mi propio hardware, por mi cuenta. Quien soy.