Geen account nodig. Geen dagelijkse limiet.Anderen geven je slechts drie bestanden per dag en noemen dat onbeperkt. Hier kun je zoveel bestanden uploaden als je wilt, tot 60 minuten per bestand.
Overal zie je de bewering "99% nauwkeurig!", maar dit wordt meestal gemeten aan de hand van ideaal audiosignaal. Hier lees je wat nauwkeurigheid echt betekent, welke factoren de nauwkeurigheid beïnvloeden, wat je realistisch kunt verwachten van je opname en hoe je een opname maakt zodat het transcript bijna perfect is.
De industriestandaard is woordfoutpercentage (WER)Neem het machinaal gegenereerde transcript, vergelijk dit met wat er daadwerkelijk is gezegd en tel drie soorten fouten: vervangingen (verkeerd woord), invoegingen (extra woord), en verwijderingen (ontbrekend woord). Deel het totaal door het aantal gesproken woorden; dat is uw WER. Een WER van 5% betekent ruwweg dat één op de twintig woorden verkeerd is, wat vaak andersom wordt weergegeven als "95% nauwkeurig"
Er zijn twee dingen die mensen over het hoofd zien bij WER: ten eerste behandelt het alle fouten gelijkelijk, maar in de praktijk heeft een verkeerd uitgesproken naam, dosering of hoeveelheid veel meer impact dan een onduidelijk "um, nou ja". Ten tweede komen gepubliceerde WER-cijfers uit benchmarkdatasets: vaak heldere audio met één spreker en een standaardaccent. Uw werkelijke cijfer is bijna volledig afhankelijk van uw opname.
De belangrijkste factor. Verkeer, gesprekken in een café, airconditioning en het getik van toetsenborden en wind concurreren allemaal met de stem. Moderne modellen zijn getraind op lawaaierige audio en komen verrassend goed om met constante achtergrondruis, maar luid of spraakachtig geluid (een tv, andere gesprekken) vervormt woorden direct.
Nauw verwant aan geluid: een spreker die twee meter van een laptopmicrofoon staat, klinkt galmend en zacht, en de nauwkeurigheid daalt aanzienlijk. Een telefoon dicht bij de spreker is beter dan een dure microfoon aan de andere kant van de kamer.
Modellen zoals Whisper zijn getraind op honderdduizenden uren meertalige audio, dus veelvoorkomende accenten worden goed getranscribeerd. Zeer sterke regionale accenten, dialecten en uitgesproken niet-moedertaaluitspraak verhogen nog steeds de foutpercentages: het model vervangt het woord door het dichtstbijzijnde woord dat het "verwacht".
Gespecialiseerde woordenschat (medische termen, productnamen, namen van personen, afkortingen) is waar fouten zich concentreren, omdat het model dit woord mogelijk nog nooit heeft gezien. Het zal vol vertrouwen een plausibel klinkend vervangend woord schrijven, en daarom is proeflezen zo belangrijk.
Afwisselend spreken is prima. Mensen die door elkaar heen praten is dat niet: overlappende spraak zorgt voor onduidelijke audio en elk transcriptiesysteem heeft er moeite mee. Panelgesprekken en verhitte vergaderingen zijn de moeilijkste scenario's.
Sterk gecomprimeerde audio (spraakopnames met een lage bitrate, telefoongesprekken, oude opnames) verwijdert precies die frequenties die vergelijkbare consonanten van elkaar onderscheiden. Vervorming (een opname die zo hard is dat het geluidsgolfpatroon vervormt) is nog erger.
| Scenario | Typisch resultaat |
|---|---|
| Podcast / voice-over, goede microfoon, één spreker | Uitstekend: meestal 97–99% van de woorden correct; bijna klaar voor publicatie |
| Zoom-/Teamsvergadering, iedereen met een headset | Zeer goed: verwacht een paar aanpassingen per pagina, voornamelijk namen |
| Interview, telefoon op tafel in een rustige ruimte | Goed: solide transcriptie, controleer namen, cijfers en stille momenten |
| Lezing, spreker ver van de recorder | Bruikbaar: het belangrijkste deel van de audio blijft intact; echoënde delen worden minder goed weergegeven |
| Gesprek in een groep met overlappende spraak, achtergrondgeluid van een café | Ruw: verwacht duidelijke fouten en door elkaar gehaalde sprekers; gebruik het als leidraad, maar citeer het niet letterlijk |
Zelfs een transcriptie die voor 97% correct is van een interview van 1500 woorden, bevat ongeveer 45 verkeerde woorden, en dat zijn vaak juist de namen, cijfers en technische termen waar het om gaat. Het doel van automatische transcriptie is niet om nul fouten te bereiken; het is dat het corrigeren van 45 woorden vijf minuten duurt, terwijl het typen van 1500 woorden met tijdstempels meer dan een uur kost. De timing, structuur en 95% van de woorden zijn al voor je gedaan.
De eerlijke manier om te antwoorden op de vraag "hoe nauwkeurig is het?" voormij? is door het te testen met je eigen opnames. ScribeGrab Gebruikt our speech model (een van de meest nauwkeurige open source spraakherkenningsmodellen), gratis, zonder dagelijkse limiet en zonder registratie, en geeft je de transcriptie plus SRT- en VTT-ondertitels op basis van één upload. Je bestand wordt direct na verwerking verwijderd.
Bij heldere, goed opgenomen spraak halen moderne modellen doorgaans 95–98% van de woorden correct (WER ongeveer 2–5%). Ruis, sterke accenten, overlappende gesprekken, jargon en slechte microfoons verminderen dit: bij lawaaierige audio met meerdere sprekers kan het percentage ver onder de 90% uitkomen.
De standaardmaatstaf voor nauwkeurigheid: substituties + invoegingen + verwijderingen, gedeeld door het aantal gesproken woorden. 5% WER ≈ 1 fout woord per 20 woorden. Lager is beter.
Gebruik een microfoon dicht bij de mond, neem op in een stille ruimte, laat één persoon tegelijk spreken, zorg voor voldoende volume zonder vervorming, gebruik originele bestanden in plaats van opnieuw gecomprimeerde en stel de taal handmatig in bij zeer korte fragmenten.
Ja, fouten komen vooral voor bij namen, cijfers en jargon – juist de woorden die belangrijk zijn. Maar het corrigeren van een paar dozijn woorden is sneller dan het hele document opnieuw typen.