Hesap oluşturmanıza gerek yok. Günlük kullanım sınırlaması da yok.Diğerleri size günde üç dosya veriyor ve buna "sınırsız" diyor. Burada 60 dakikaya kadar olan dosyaları istediğiniz sıklıkta yükleyebilirsiniz.
Her yerde "yüzde 99 doğruluk" iddiaları var ve bunlar genellikle ideal ses kayıtları üzerinde ölçülüyor. İşte doğruluk aslında ne anlama geliyor, onu bozan faktörler neler, kaydınızdan gerçekçi olarak ne beklemelisiniz ve transkripsiyonun neredeyse kusursuz çıkması için nasıl kayıt yapmalısınız.
Sektör standardı şudur kelime hata oranı (WER)Makine tarafından oluşturulan metni alın, gerçekte söylenenlerle karşılaştırın ve üç tür hatayı sayın: değiştirmeler (yanlış kelime), eklemeler (fazladan kelime), ve silmeler (eksik kelime). Toplamı konuşulan kelime sayısına bölün; bu, Kelime Hata Oranınızdır (WER). %5 WER, kabaca yirmi kelimeden birinin yanlış olduğu anlamına gelir; genellikle bunun tersi olarak "%95 doğruluk" şeklinde ifade edilir
İnsanların WER hakkında gözden kaçırdığı iki şey: ilk olarak, tüm hataları eşit şekilde ele alır, ancak pratikte bozuk bir isim, doz veya miktar, sakatlaşmış bir "şey, yani..." ifadesinden çok daha fazla zarar verir. İkinci olarak, yayınlanan WER sayıları genellikle temiz, tek konuşmacılı ve yerel aksanlı seslerden oluşan kıyaslama veri kümelerinden gelir. Gerçek dünyadaki sayınız neredeyse tamamen kaydınıza bağlıdır.
En büyük etkiyi yaratan faktör. Trafik, kafedeki konuşmalar, klima, klavye sesi ve rüzgarın hepsi sesle yarışır. Modern modeller gürültülü ses üzerinde eğitilir ve sabit bir arka plan uğultusuna karşı şaşırtıcı derecede iyi performans gösterir, ancak yüksek veya konuşmaya benzer gürültü (televizyon, diğer konuşmalar) kelimeleri doğrudan bozar.
Gürültüyle yakından ilişkili: bir dizüstü bilgisayar mikrofonundan iki metre uzakta duran bir kişinin sesi yankılı ve kısık duyulur ve doğruluk önemli ölçüde azalır. Hoparlörün yakınında bulunan bir telefon, odanın diğer ucundaki pahalı bir mikrofondan daha iyi performans gösterir.
Whisper gibi modeller yüz binlerce saatlik çok dilli ses üzerinde eğitildiğinden, yaygın aksanlar iyi transkribe edilir. Çok belirgin bölgesel aksanlar, lehçeler ve güçlü bir şekilde ana dili olmayan telaffuzlar hala hata oranlarını artırır: model, "beklediği" en yakın kelimeyle değiştirme yapar.
Uzmanlık alanına ait sözcükler (tıbbi terimler, ürün adları, kişilerin adları, kısaltmalar) hata oluşumunun yoğunlaştığı yerdir, çünkü model bu kelimeyi daha önce hiç görmemiş olabilir. Anlamlı bir şekilde kulağa hoş gelen bir yedek kelime yazacaktır; tam da bu nedenle düzeltme okuma önemlidir.
Sırayla konuşmak sorun değil. İnsanlar birbirlerinin sözünü kesmek sorunlu: üst üste gelen konuşmalar gerçekten anlaşılması zor ses kayıtları oluşturur ve her transkripsiyon sistemi bununla başa çıkmakta zorlanır. Panel tartışmaları ve hararetli toplantılar en zorlu senaryolardır.
Aşırı sıkıştırılmış ses (düşük bit hızında ses kayıtları, telefon görüşmeleri, eski kayıtlar), benzer ünsüzleri ayırt eden frekansları ortadan kaldırır. Yüksek seste kaydedilen ve dalga biçiminin bozulmasına neden olan kayıtlar daha da kötüdür.
| Senaryo | Tipik sonuç |
|---|---|
| Podcast / seslendirme, iyi mikrofon, tek konuşmacı | Mükemmel: genellikle kelimelerin %97-99'u doğru; neredeyse yayınlanabilir |
| Zoom/Teams toplantısı, herkes kulaklıkla | Çok iyi: sayfa başına birkaç düzeltme beklenir, çoğunlukla isimler |
| Röportaj, sessiz bir odada masanın üzerinde telefon | İyi: sağlam transkript, isimleri, sayıları ve sessiz anları kontrol edin |
| Ders, konuşmacı kayıt cihazından uzakta | Kullanılabilir: Ana içerik anlaşılır şekilde kaydedilir; yankılı bölümler kalitesizleşir |
| Arka plan gürültüsü ve konuşma karışıklığı olan grup sohbeti | Kaba/Kalitesiz: Gerçek boşluklar ve karıştırılmış konuşmacılar beklenir; sadece genel bir fikir edinmek için kullanın, birebir alıntı yapmayın |
1.500 kelimelik bir röportajın %97 doğrulukta dahi olsa yaklaşık 45 yanlış kelime içerir ve bunlar orantısız olarak sizin için önemli olan isimler, sayılar ve teknik terimlerdir. Otomatik transkripsiyonun amacı sıfır hata olmasını sağlamak değil; 45 kelimeyi düzeltmek beş dakika sürerken, 1.500 kelimeyi zaman damgalarıyla yazmak bir saatten fazla sürer. Zamanlama, yapı ve kelimelerin %95'inden fazlası sizin için zaten yapılmıştır.
"Ne kadar doğru?" sorusuna dürüstçe cevap vermek için.. ...gerçek kayıtlarınızla test edinour speech model (en doğru açık kaynaklı konuşma tanıma modellerinden biri), ücretsiz, günlük kullanım sınırı ve kayıt gerektirmiyor ve size transkriptin yanı sıra ScribeGrab SRT ve VTT altyazılarını tek bir yükleme ile sunar. Dosyanız işlendikten hemen sonra silinir Bir dosyayı ücretsiz olarak transkribe edin → (one of the most accurate open speech-recognition models), free, with no daily cap and no sign-up, and gives you the transcript plus SRT and VTT subtitles from one upload. Your file is deleted right after processing.
Net ve iyi kaydedilmiş bir konuşmada, modern modeller genellikle kelimelerin %95-98'ini doğru tahmin eder (Kelime Hatası Oranı yaklaşık %2-5). Gürültü, yoğun aksanlar, çapraz konuşma, teknik terimler ve kalitesiz mikrofonlar bu oranı düşürür: gürültülü, çoklu konuşmacı içeren ses kayıtlarında doğruluk %90'ın altına düşebilir.
Standart doğruluk ölçütü: yapılan değişiklikler (yerine koyma + ekleme + silme), söylenen kelime sayısına bölünerek hesaplanır. %5 WER ≈ 20 kelimeden 1'inin yanlış olduğu anlamına gelir. Daha düşük değer daha iyidir.
Mikrofonu kaynağa yakın tutun, sessiz bir ortamda kaydedin, aynı anda tek bir kişinin konuşmasını sağlayın, sesi bozulmadan ideal seviyede ayarlayın, yeniden sıkıştırılmış dosyalar yerine orijinal dosyaları kullanın ve çok kısa ses kayıtlarında dili manuel olarak ayarlayın.
Evet, hatalar genellikle isimlerde, sayılarda ve teknik terimlerde yoğunlaşır; yani en önemli kelimelerde. Ancak birkaç düzine kelimeyi düzeltmek, tüm metni yeniden yazmaktan çok daha hızlıdır.