SCRIBEGRAB

Transformez n’importe quel fichier audio ou vidéo en texte et sous-titres

Gratuit, pas d’inscription requise, sans filigrane. Une heure d’audio prend environ deux minutes.

Vous n’avez pas de fichier sous la main ? Copiez-collez un lien YouTube ci-dessous. Les sous-titres peuvent être traduits dans 16 langues.

ou collez un lien
Téléchargement en cours…

Collez un lien YouTube et il est restitué en quelques secondes – et si la vidéo n’a pas de sous-titres, nous les transcrivons quand même, ce qui fait souvent défaut aux autres outils. Interviews, conférences, podcasts, mémos vocaux : fichiers d’une durée maximale de 90 minutes chacun, sans inscription ni filigrane.

De l’enregistrement à la transcription

1. Déposez un fichier

Tout format audio ou vidéo courant. La transcription commence immédiatement : pas d’inscription, pas d’e-mail, pas de limite quotidienne.

2. L’outil le transcrit

Un modèle de reconnaissance vocale le transcrit sur notre GPU, détecte automatiquement la langue et identifie qui parle lorsqu’il y a plusieurs voix, généralement beaucoup plus rapidement qu’en temps réel.

3. Télécharger

Obtenez la transcription brute au format TXT et les sous-titres avec horodatage aux formats SRT et VTT. Votre fichier est automatiquement supprimé après le téléchargement.

17 secondes, rien n’est coupé : un enregistrement entre et ressort sous forme de transcription, avec les fichiers TXT, SRT et VTT prêts à être téléchargés.
AUDIO transcrire transcript.txt 00:00 Bienvenue à tous ! 00:04 Aujourd’hui, nous testons trois microphones économiques.
Enregistrement vocal entrant, transcription textuelle propre et horodatée en sortie : la transcription conserve un horodatage pour chaque ligne.

Trois types d’enregistrements

CRÉATEURS

Sous-titres pour vidéos

Sous-titres SRT/VTT pour YouTube, Reels et TikTok : accessibilité et portée accrues, sans payer à la minute.

TRAVAIL ET ÉTUDES

Interviews et conférences

Transformez les interviews, réunions et conférences enregistrées en texte consultable que vous pouvez citer et parcourir rapidement, divisé par intervenant afin de savoir qui a dit quoi.

PODCASTS

Notes d’épisode

Une transcription complète par épisode pour les notes de l’émission et le référencement : chaque mot prononcé dans votre épisode est indexable.

Questions sur la transcription

Est-ce vraiment gratuit ?

Oui : pas de compte à créer, pas de filigrane, pas de frais par minute ni de limite quotidienne, et l’outil gratuit n’est pas une version d’essai ; il ne se termine pas et utilise le même modèle que tous les autres outils disponibles ici. Les publicités permettent de maintenir le GPU en fonctionnement. Il existe un seul supplément facultatif : un abonnement mensuel de 5 € qui inclut des notes de réunion, l’identification des intervenants, l’exportation vers Word et des limites plus élevées. Cela vous permet d’en faire davantage avec votre transcription, pas d’obtenir une meilleure transcription.

Que devient mon fichier ?

Il est traité sur notre propre serveur et supprimé dès qu’il a fini de l’être ; les résultats sont effacés dans les 45 minutes. Rien n’est stocké, partagé ou utilisé pour l’entraînement. Consultez la Politique de confidentialité.

Quelle est sa précision ?

Nous utilisons notre modèle vocal, l’un des meilleurs modèles open source de reconnaissance vocale. Une parole claire est transcrite avec une grande précision ; les accents forts, les conversations croisées, le bruit de fond ou les enregistrements de mauvaise qualité sont plus difficiles à traiter pour tout outil. Relisez toujours la transcription rapidement.

Indique-t-il qui parle ?

Oui. Lorsqu’il détecte plus d’une voix, il divise automatiquement la transcription en séquences par intervenant, jusqu’à huit intervenants, sans qu’il soit nécessaire d’activer une option. C’est ce qui rend une interview ou un enregistrement de réunion lisible au lieu d’un long bloc de texte. Les étiquettes sont estimées par l’IA. Par conséquent, vérifiez rapidement les conversations croisées ou les voix très similaires.

Est-ce qu'il peut censurer les jurons ?

Oui. Cochez la case « Créer également une version propre ou sous-titrée » avant de télécharger et vous recevrez un deuxième fichier dans lequel chaque juron aura été remplacé par un bip, coupé ou rendu muet De plus, si vous le souhaitez, les hésitations (« euh ») et les longs silences seront également supprimés. Vous verrez d’abord la liste complète avec les horodatages et pourrez laisser n’importe quel mot. Pour en savoir plus sur la censure des jurons, consultez cette page Et pour la suppression des mots de remplissage.

Quelles langues et quels types de fichiers ?

Environ 100 langues, détectées automatiquement (ou vous pouvez en choisir une). Audio et vidéo : MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM et plus encore, jusqu’à 2 Go et 90 minutes.

Puis-je obtenir des sous-titres pour une vidéo ?

Oui, téléchargez la vidéo directement et téléchargez le fichier SRT ou VTT. Placez le fichier SRT à côté de votre vidéo ou téléchargez-le sur YouTube en tant que sous-titres.

Pouvez-vous intégrer les sous-titres dans la vidéo elle-même ?

Oui. Instagram, TikTok, WhatsApp et la plupart des téléviseurs ignorent un fichier de sous-titres séparé. Cochez donc la case « Créer également une version propre ou sous-titrée » avant de télécharger, choisissez l’une des trois options (Classique, Encadrée ou Grande) et téléchargez un fichier MP4 avec le texte intégré à l’imagePas besoin d’installer un logiciel, pas de filigrane, et votre fichier original reste intact. Guide complet : Comment ajouter des sous-titres à n'importe quelle vidéo.

Vous souhaitez plutôt séparer une chanson en pistes séparées ?

Voici notre outil complémentaire : StemGrab il sépare la voix, la batterie, la basse et les instruments, et est également gratuit.

Où précisément l’exactitude diminue-t-elle ?

Sur un enregistrement clair d’une personne parlant anglais, le modèle obtient environ quatre-vingt-dix-huit mots corrects sur cent ; nous avons mesuré 1,94 % d’erreurs de mots dans une parole claire. Trois éléments nuisent le plus. Les interférences, lorsque deux personnes se parlent en même temps, car le modèle doit choisir l’une des voix. La distance par rapport au microphone, car un téléphone placé à l’extrémité d’une table de réunion capte davantage le bruit ambiant que la voix. Et le vocabulaire inhabituel : les noms, les marques, le jargon et les abréviations sont déduits du contexte, de sorte qu’un nom de famille qu’il n’a jamais vu se traduit par quelque chose qui ressemble simplement à ce nom. Les accents forts sont mieux gérés que la plupart des gens ne le pensent ; la musique de fond est moins bien gérée.

Pourquoi n’y a-t-il pas de limite quotidienne, alors que d’autres outils de transcription gratuits imposent une limite ?

La reconnaissance vocale nécessite du temps de calcul sur GPU, et la plupart des outils de transcription gratuits louent ce temps auprès d’un service cloud par minute audio ; c’est précisément pour cela qu’il existe une limite de trois fichiers par jour et de vingt minutes. Nous possédons le matériel : les mêmes cartes graphiques font fonctionner nos autres outils aux Pays-Bas, de sorte qu’un enregistrement supplémentaire coûte en électricité plutôt qu’en facturation, et les publicités sur la page couvrent ces coûts. C’est pourquoi les fichiers peuvent atteindre quatre-vingt-dix minutes et deux gigaoctets chacun, aussi nombreux que vous le souhaitez, sans avoir besoin d’un compte ou d’une adresse e-mail.

Les utilisations populaires de ScribeGrab