SCRIBEGRABAbra la herramienta →

Notas de voz obsidianas, transcrito gratis

Sin cuenta. 10 grabaciones al día. Otros le dan tres archivos al día y lo llaman ilimitado. Archivos de hasta 60 minutos aquí, y se reinicia a medianoche.

Los complementos de Whisper para Obsidian le permiten elegir el servidor con el que se conectan. La mayoría de las personas lo dejan configurado en OpenAI y pagan $0.006 por cada minuto que dictan. Cambie un campo a ScribeGrab y el mismo complemento seguirá funcionando, en mi tarjeta gráfica, de forma gratuita y sin necesidad de una clave API.

El único campo que importa

En la configuración del plugin hay un URL de la API caja, llena de https://api.openai.com/v1/audio/transcriptionsReemplazarlo con:

https://scribegrab.com/v1/audio/transcriptions

Esa es toda la configuración. El punto final utiliza la API de transcripción de OpenAI, el mismo formulario multipart y el mismo JSON de respuesta, por lo que el complemento no sabe ni le importa que ya no se esté comunicando con OpenAI.

Deje la caja clave de API vacía. No hay clave para conseguir ni cuenta para hacer. Si su plugin insiste en algo en ese campo, escriba cualquier texto: un Authorization el encabezado es aceptado y tirado.

Todos los ajustes, explicados

Los nombres de campo a continuación son de plugin de nikdanilov Whisper, el popular. Otros plugins usan las mismas palabras en un orden diferente.

ConfiguraciónQué incluir
Clave de la API de WhisperDéjelo en blanco. Se ignorará si lo completa de todos modos.
URL de la APIhttps://scribegrab.com/v1/audio/transcriptions
ModeloCualquier cosa... whisper-1 Está bien. Cada solicitud funciona el mismo modelo, porque ese es el único en la tarjeta.
IdiomaVacío para auto-detecto (cerca de 100 idiomas), o un código como en, nl, de. La palabra auto se entiende también.
IndicaciónSe acepta e ignora. Las sugerencias de vocabulario no llegan al modelo aquí.
TemperaturaSe acepta e ignora; el transcriptor utiliza su propia escala de respaldo.
Formato de respuestajson es lo que esperan los plugins. text, srt, vtt y verbose_json también trabajo.

Pruébalo en diez segundos.

Antes de confiar en él con una grabación real, envíale cualquier archivo de audio desde una terminal:

curl https://scribegrab.com/v1/audio/transcriptions \
  -F [email protected] \
  -F model=whisper-1

{"text":"This is the first sentence of the memo."}

Añadir -F response_format=srt para subtítulos codificados por el tiempo, o verbose_json para una lista de segmentos con tiempos de inicio y final. La solicitud permanece abierta hasta que exista la transcripción, exactamente como la de OpenAI — Una nota de voz de dos minutos suele volver en unos segundos.

Los límites, honestamente.

Esto es la computadora de una sola persona, no una región en la nube. Todo lo que se indica a continuación sigue la misma regla que utiliza el propio sitio web, no una capa de API especial:

¿Qué sucede con su grabación?

Tu audio va a una máquina en mi casa, se transcribe, y el archivo subido es borrado el momento en que existe la transcripción. La transcripción en sí se limpia en 45 minutos (24 horas si compraste un pase de mes — que ventana más larga es parte de lo que el pase es para). Nada se mantiene, vende o se utiliza para entrenar cualquier cosa, y su grabación nunca se envía a OpenAI, Google o cualquier otra API — todo el punto de este sitio es que tampoco paga por minuto. Detalles en Política de privacidad.

Dicho esto: sigue siendo mi máquina. Si una grabación es lo suficientemente confidencial como para que el servidor de un desconocido sea un problema, ejecuta un modelo localmente; este consejo no me cuesta nada y es el consejo correcto.

No solo para Obsidian.

Cualquier cosa que te permita establecer una URL base de OpenAI puede usar esto: lanzadores de dictados, scripts de shell, a Makefile que subtitúa tus grabaciones de pantalla. Si su herramienta pide un URL en lugar de un punto final completo, darle https://scribegrab.com/v1 y anexará el resto en sí.

ScribeGrab no está afiliado con OpenAI ni con Obsidian; "compatible con OpenAI" significa que acepta la misma solicitud y devuelve el mismo tipo de respuesta.

¿Ya deja notas de reunión en Obsidian? Si la fuente es un PDF en lugar de un archivo de audio, PDF de ScanReviver a Markdown lo convierte de la misma manera — rumbos guardados como partidas, listos para la misma bóveda.

También se rompió una foto de la pizarra durante esa misma reunión? ScanReviver foto de pizarra blanca en PDF lo limpia en un PDF recto que puede caer en la misma carpeta de notas.

Preguntas

¿Por qué es gratis? ¿Cuál es el truco?

Las tarjetas ya están compradas y pagadas, por lo que tu audio me cuesta electricidad y nada más. Los anuncios en el sitio web cubren eso. El truco es la cola y la falta de garantía de tiempo de actividad, eso es todo, y ambos están explicados arriba.

Mi complemento dice "grabación demasiado corta".

Ese es el complemento, antes de que llegue a mí: la mayoría se niegan a enviar clips de menos de un segundo. Habla durante unos segundos más.

Recibo el mensaje "No se pudo leer la duración del archivo multimedia" o "no hay ninguna pista de audio".

El primero significa que el archivo está truncado o corrupto — nada en ella dice cuánto tiempo es, y rehúso cualquier cosa que no pueda medir en lugar de dejar que mastique en la tarjeta para siempre. Grabaciones del navegador que dejan la longitud abierta (la habitual .webm de un plugin) están bien: los que se miden correctamente. El segundo significa que realmente no hay sonido en él, que sucede con grabaciones de pantalla silenciosa.

¿Puedo enviar un enlace de YouTube en lugar de un archivo?

No por este punto final — La API de OpenAI no tiene campo para ello. El sitio web hace: pegar el enlace en la página YouTube.

Pruébalo en el navegador primero →

Retrato ilustrado de Sam RidderPor Sam Ridder —Construyo y ejecuto ScribeGrab en mi propio hardware, por mi cuenta. Quien soy.