Gratis, sin registro, sin marca de agua. Una hora de audio tarda unos dos minutos.
¿No tienes un archivo a la mano? Pega un enlace de YouTube abajo. Los subtítulos se pueden traducir a 16 idiomas.
Pega un enlace de YouTube y en un segundo tienes la transcripción — y si ese video no tiene subtítulos, lo transcribimos igual, que es donde la mayoría de las herramientas se rinde. Entrevistas, clases, pódcasts, notas de voz: archivos de hasta 60 minutos cada uno, sin registro, sin marca de agua.
Cualquier formato común de audio o video. La transcripción empieza de inmediato: sin registro, sin correo, con 10 grabaciones al día.
Un modelo de reconocimiento de voz lo transcribe en nuestra GPU, detecta el idioma automáticamente y etiqueta quién habla cuando hay más de una voz, normalmente mucho más rápido que en tiempo real.
Obtén la transcripción simple como TXT y los subtítulos con marcas de tiempo como SRT y VTT. Tu archivo subido se borra automáticamente.
Lo que está en esta página es la herramienta completa, no una versión de prueba. Un pase no cambia la transcripción ni la hace mejor — agrega lo que haces con la transcripción después.
Esta es la herramienta completa, no una prueba. Mismo modelo y misma transcripción que con un pase — aquí no hay nada desactivado.
Lo gestiona Polar, nuestro proveedor de pagos — ellos se encargan del pago y del IVA. Aquí no hay cuentas: tu pase se guarda en este navegador.
Subtítulos SRT/VTT para YouTube, Reels y TikTok: accesibilidad y alcance, sin pagar por minuto.
Convierte entrevistas, reuniones y clases grabadas en texto donde puedes buscar, citar y hojear, dividido por hablante para ver quién dijo qué.
Una transcripción completa por episodio para las notas y el SEO: cada palabra que dice tu episodio, indexable.
Sí: sin registro, sin marca de agua, sin cobro por minuto, 10 grabaciones al día, y la herramienta gratuita no es una prueba — no caduca y usa el mismo modelo que todo lo demás aquí. La publicidad mantiene la GPU funcionando. Hay un único extra opcional: un pase mensual de €5 con minutas de reunión, nombres reales de hablantes, exportación a Word y límites más altos. Te da más cosas que hacer con tu transcripción, no una transcripción mejor.
Se procesa en nuestro propio servidor y se elimina en cuanto termina; los resultados se borran en un máximo de 45 minutos (24 horas si compraste un pase mensual; ese período más largo es parte de lo que ofrece el pase). No se guarda, no se comparte ni se usa nada para entrenar. Mira la Política de Privacidad (en inglés).
Usamos uno de los mejores modelos disponibles de reconocimiento de voz. El habla clara se transcribe con mucha precisión; los acentos fuertes, las voces superpuestas, el ruido de fondo o las grabaciones de mala calidad son difíciles para cualquier herramienta. Dale siempre un vistazo rápido.
Sí. Cuando oye más de una voz, divide la transcripción en turnos de hablante automáticamente, hasta ocho hablantes, sin activar nada. Eso es lo que hace legible una entrevista o la grabación de una reunión en lugar de un solo bloque de texto. Las etiquetas las estima la IA, así que con voces superpuestas o muy parecidas dales un vistazo rápido.
Sí. Elige “Transcripción + video editado” antes de subir y recibes un segundo archivo con cada grosería tapada con un pitido, silenciada o recortada — y, si quieres, también los “em” y los silencios largos. Primero ves la lista completa con marcas de tiempo y puedes dejar cualquier palabra. Más sobre censurar groserías y quitar muletillas (guías en inglés).
Unos 100 idiomas, detectados automáticamente (o elige uno). Audio y video: MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM y más, hasta 1,5 GB y 60 minutos.
Sí, sube el video directamente y descarga el archivo SRT o VTT. Pon el SRT junto a tu video o súbelo a YouTube como subtítulos.
Sí. Instagram, TikTok, WhatsApp y la mayoría de los televisores ignoran un archivo de subtítulos aparte, así que elige “Transcripción + video editado” antes de subir, escoge uno de los tres estilos (Clásico, Recuadro o Grande) y descarga un MP4 con el texto incrustado en la imagen. Sin editor que instalar, sin marca de agua, y tu archivo original queda intacto. Guía completa (en inglés): cómo agregar subtítulos a cualquier video.
Esa es nuestra herramienta hermana: StemGrab separa voces, batería, bajo e instrumental, también gratis.
En una grabación clara de una sola persona hablando inglés, el modelo acierta aproximadamente con noventa y ocho palabras de cada cien — medimos un 1,94% de errores en la transcripción de habla limpia. Hay tres factores que afectan más. El diálogo simultáneo, cuando dos personas hablan a la vez, porque el modelo tiene que elegir una. La distancia del micrófono, ya que un teléfono al otro lado de una mesa de reuniones capta más ruido ambiente que voz. Y el vocabulario inusual: los nombres, marcas, jerga y abreviaturas se adivinan por contexto, así que un apellido desconocido puede aparecer como algo que simplemente suena parecido. Los acentos marcados se manejan mejor de lo que la mayoría espera; la música de fondo se maneja peor.
El reconocimiento de voz consume tiempo de GPU, y la mayoría de los transcriptores gratuitos alquilan ese tiempo a un servicio en la nube por minuto de audio — que es precisamente lo que las limitaciones de tres archivos al día y veinte minutos existen para proteger. Nosotros somos dueños del hardware: las mismas tarjetas gráficas que impulsan nuestras otras herramientas funcionan en los Países Bajos, así que una grabación adicional consume electricidad en lugar de generar una factura, y los anuncios en la página cubren ese coste. Por eso los archivos pueden llegar a noventa minutos y dos gigabytes cada uno, tantos como quieras, sin necesidad de cuenta ni de correo electrónico.
Estas guías están en inglés.