Pas besoin de compte. Pas de limite quotidienne.D’autres vous proposent trois fichiers par jour et prétendent que c’est illimité. Ici, vous pouvez télécharger des fichiers jusqu’à 60 minutes aussi souvent que vous le souhaitez.
Les affirmations du type « 99 % de précision ! » sont omniprésentes et mesurent généralement la qualité audio dans des conditions idéales. Voici ce que signifie réellement la précision, ce qui peut l’affecter, ce à quoi vous pouvez raisonnablement vous attendre de votre enregistrement et comment enregistrer pour obtenir une transcription presque parfaite.
La référence du secteur est taux d’erreurs par mot (WER)Prenez la transcription automatique, comparez-la à ce qui a été réellement dit et comptez trois types d’erreurs : substitutions (mot incorrect), insertions (mot en trop), et suppressions (mot manquant). Divisez le total par le nombre de mots prononcés, et vous obtiendrez votre taux d’erreur (WER). Un WER de 5 % signifie qu’environ un mot sur vingt est incorrect, ce qui est souvent exprimé à l’inverse comme « 95 % de précision »
Deux aspects que les gens négligent concernant le WER : premièrement, il traite toutes les erreurs de la même manière, mais en pratique, une erreur dans un nom, un dosage ou une quantité a des conséquences bien plus importantes qu’une déformation du mot « euh, enfin ». Deuxièmement, les chiffres WER publiés proviennent d’ensembles de données de référence : il s’agit souvent d’enregistrements propres, avec un seul locuteur et un accent natif. Votre taux réel dépend presque entièrement de votre enregistrement.
C’est le facteur le plus important. Le bruit de la circulation, les conversations dans un café, la climatisation, le cliquetis du clavier et le vent concurrencent tous la voix. Les modèles modernes sont entraînés sur des enregistrements bruyants et gèrent étonnamment bien un bourdonnement de fond constant, mais un bruit fort ou ressemblant à une parole (une télévision, d’autres conversations) corrompt directement les mots.
Ce facteur est étroitement lié au bruit : un locuteur situé à deux mètres d’un microphone d’ordinateur portable a une voix qui résonne et qui est faible, et la précision diminue considérablement. Un téléphone placé près du locuteur donne de meilleurs résultats qu’un microphone coûteux placé de l’autre côté de la pièce.
Les modèles modernes de reconnaissance vocale sont entraînés sur des centaines de milliers d’heures d’enregistrements audio multilingues, de sorte que les accents courants se transposent bien. Cependant, les accents régionaux très marqués, les dialectes et la prononciation fortement non native augmentent toujours le taux d’erreur : le modèle substitue le mot le plus proche qu’il « attend ».
Le vocabulaire spécialisé (termes médicaux, noms de produits, noms de personnes, acronymes) est là où les erreurs se concentrent, car le modèle n’a peut-être jamais rencontré ce mot. Il écrira avec assurance un remplacement plausible, ce qui explique précisément pourquoi la relecture est importante.
Les conversations où chacun prend la parole à tour de rôle sont acceptables. Les personnes qui se coupent la parole ne le sont pas : les chevauchements de paroles créent un son véritablement ambigu et tous les systèmes de transcription ont du mal à gérer cela. Les discussions en groupe et les réunions animées représentent les scénarios les plus difficiles.
Un fichier audio fortement compressé (notes vocales basse résolution, appels téléphoniques, anciens enregistrements) supprime précisément les fréquences qui distinguent les consonnes similaires. Le clipping (enregistrement avec un volume sonore si élevé que la forme d’onde se déforme) est encore pire.
| Scénario | Résultat typique |
|---|---|
| Podcast / voix off, bon microphone, un seul orateur | Excellent : généralement 97 à 99 % des mots corrects ; presque prêt à être publié |
| Réunion Zoom/Teams, tout le monde avec un casque | Très bien : prévoyez quelques corrections par page, principalement les noms |
| Entretien, téléphone posé sur la table dans une pièce calme | Bien : transcription solide, vérifiez les noms, les chiffres et les moments de silence |
| Conférence, orateur éloigné de l’enregistreur | Qualité acceptable : le contenu principal est intelligible, les sections avec beaucoup de réverbération sont moins bonnes |
| Conversation de groupe avec des voix qui se chevauchent et du bruit de café | Résultat approximatif : attendez-vous à des interruptions importantes et à un mélange confus des locuteurs ; utilisez ces transcriptions pour avoir une idée générale, mais ne les citez pas textuellement |
Même une transcription précise à 97 % d’un entretien de 1 500 mots contient environ 45 mots incorrects, et ce sont souvent les noms, les chiffres et les termes techniques qui vous intéressent. L’objectif de la transcription automatique n’est pas l’absence totale d’erreurs, mais plutôt le fait que corriger 45 mots prend cinq minutes, alors que taper 1 500 mots avec des horodatages prend plus d’une heure. Le minutage, la structure et 95 % des mots sont déjà faits pour vous.
La façon la plus honnête de répondre à la question « quelle est sa précision pour… » moi…est de le tester avec vos enregistrements réels. ScribeGrab utilise our speech model (l’un des modèles de reconnaissance vocale open source les plus précis), gratuitement, sans limite quotidienne et sans inscription, et vous fournit la transcription ainsi que les sous-titres SRT et VTT à partir d’un seul téléchargement. Votre fichier est supprimé immédiatement après le traitement.
Pour un enregistrement clair et de bonne qualité, les modèles modernes atteignent généralement une précision de 95 à 98 % (taux d’erreur de mot d’environ 2 à 5 %). Le bruit, les accents prononcés, les interférences, le jargon et les microphones de mauvaise qualité réduisent cette précision : un enregistrement audio bruyant avec plusieurs locuteurs peut descendre bien en dessous de 90 %.
La mesure standard de la précision : substitutions + insertions + suppressions, divisé par le nombre de mots prononcés. Un WER de 5 % correspond à environ 1 mot incorrect sur 20. Plus c’est bas, mieux c’est.
Utilisez un microphone rapproché, enregistrez dans une pièce calme, enregistrez une seule voix à la fois, assurez-vous d’avoir un bon niveau sonore sans écrêtage, utilisez les fichiers originaux au lieu de ceux qui ont été recompressés et définissez manuellement la langue pour les clips très courts.
Oui, les erreurs se concentrent sur les noms, les chiffres et le jargon, c’est-à-dire précisément les mots importants. Mais corriger quelques dizaines de mots est plus rapide que de retaper tout le texte.