Grátis, sem cadastro, sem marca d'água. Uma hora de áudio leva cerca de dois minutos.
Sem arquivo à mão? Cole um link do YouTube abaixo. As legendas podem ser traduzidas para 16 idiomas.
Cole um link do YouTube e a transcrição volta em um segundo — e, se o vídeo não tiver legendas, nós transcrevemos mesmo assim, que é onde a maioria das ferramentas desiste. Entrevistas, aulas, podcasts, notas de voz: arquivos de até 60 minutos cada, sem cadastro, sem marca d'água.
Qualquer formato comum de áudio ou vídeo. A transcrição começa na hora: sem cadastro, sem e-mail. 10 gravações grátis por dia.
Um modelo de reconhecimento de fala transcreve na nossa GPU, detecta o idioma automaticamente e identifica quem está falando quando há mais de uma voz — em geral bem mais rápido que o tempo real.
Receba a transcrição simples em TXT e legendas com tempos em SRT e VTT. Seu envio é apagado automaticamente.
O que está nesta página é a ferramenta completa, não uma versão de teste. Um passe não muda a transcrição nem a torna melhor — ele acrescenta o que você faz com a transcrição depois.
Esta é a ferramenta completa, não um teste. Mesmo modelo e mesma transcrição de quem tem passe — nada aqui está desligado.
Processado pela Polar, nossa provedora de pagamentos — ela cuida do pagamento e dos impostos. Sem cadastro aqui: seu passe fica salvo neste navegador.
Legendas SRT/VTT para YouTube, Reels e TikTok: acessibilidade e alcance, sem pagar por minuto.
Transforme entrevistas, reuniões e aulas gravadas em texto pesquisável para citar e folhear, separado por falante para ver quem disse o quê.
Uma transcrição completa por episódio para as notas e o SEO: cada palavra que o seu episódio diz, indexável.
Sim: sem cadastro, sem marca d'água, sem cobrança por minuto, com 10 gravações grátis por dia — e a ferramenta gratuita não é um teste: não expira e roda o mesmo modelo de todo o resto aqui. Os anúncios mantêm a GPU funcionando. Há um único extra opcional: um passe mensal de €5 com ata de reunião, nomes reais dos falantes, exportação para Word e limites maiores. Ele dá mais o que fazer com a sua transcrição, não uma transcrição melhor.
Ele é processado no nosso próprio servidor e apagado assim que termina; os resultados são apagados em até 45 minutos (24 horas se você comprou um passe mensal — esse período mais longo faz parte dos benefícios do passe). Nada é armazenado, compartilhado ou usado para treinamento. Veja a Política de Privacidade (em inglês).
Usamos um dos melhores modelos disponíveis de reconhecimento de fala. Fala clara é transcrita com muita precisão; sotaques fortes, vozes sobrepostas, ruído de fundo ou gravações ruins são difíceis para qualquer ferramenta. Sempre faça uma revisão rápida.
Sim. Quando ouve mais de uma voz, ele divide a transcrição em turnos de fala automaticamente, com até oito falantes, sem precisar ativar nada. É isso que torna uma entrevista ou a gravação de uma reunião legível em vez de um bloco único de texto. Os rótulos são estimados por IA, então, com vozes sobrepostas ou muito parecidas, vale conferir.
Sim. Escolha “Transcrição + vídeo editado” antes de enviar e você recebe um segundo arquivo com cada palavrão coberto por bipe, silenciado ou cortado — e, se quiser, também os “hã”s e os silêncios longos. Você vê a lista completa com os tempos antes e pode deixar qualquer palavra como está. Mais sobre censurar palavrões e remover vícios de linguagem (guias em inglês).
Cerca de 100 idiomas, com detecção automática (ou escolha um). Áudio e vídeo: MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM e mais, até 1,5 GB e 60 minutos.
Sim, envie o vídeo diretamente e baixe o arquivo SRT ou VTT. Coloque o SRT ao lado do seu vídeo ou envie ao YouTube como legenda.
Sim. Instagram, TikTok, WhatsApp e a maioria das TVs ignoram um arquivo de legenda separado, então escolha “Transcrição + vídeo editado” antes de enviar, escolha um dos três estilos (Clássico, Caixa ou Grande) e baixe um MP4 com o texto gravado na imagem. Sem editor para instalar, sem marca d'água, e o seu arquivo original fica intacto. Guia completo (em inglês): como adicionar legendas a qualquer vídeo.
É a nossa ferramenta irmã: o StemGrab separa vocais, bateria, baixo e instrumental, também grátis.
Em uma gravação clara de uma pessoa falando inglês, o modelo acerta aproximadamente noventa e oito palavras em cada cem — medimos 1,94% de erros nas palavras em gravações limpas. Três coisas atrapalham mais. Conversas sobrepostas, quando duas pessoas falam ao mesmo tempo, porque o modelo precisa escolher uma. A distância do microfone, já que um celular na outra ponta da mesa capta mais ruído ambiente do que a voz. E vocabulário incomum: nomes, marcas, jargões e abreviações são adivinhados pelo contexto, então um sobrenome que ele nunca viu pode sair como algo que apenas soa parecido. Sotaques fortes são tratados melhor do que a maioria das pessoas espera; música de fundo é tratada pior.
O reconhecimento de fala consome tempo de GPU, e a maioria dos transcritores gratuitos aluga esse tempo de um serviço na nuvem por minuto de áudio — que é exatamente o que os limites de três arquivos por dia e vinte minutos existem para proteger. Nós somos donos do hardware: as mesmas placas gráficas rodam nossas outras ferramentas na Holanda, então uma gravação extra custa eletricidade em vez de uma fatura, e os anúncios na página cobrem esse custo. É por isso que os arquivos podem ter até 60 minutos e 1,5 GB cada, e por isso o limite gratuito é um generoso 10 por dia, sem precisar de conta ou de e-mail.
Os guias com link abaixo estão em inglês.