无需注册账户。没有每日使用限制。其他平台每天只提供三个文件,却声称是无限量。这里的文件时长可达 60 分钟,您可以随意使用。
“准确率高达 99%!”这样的说法随处可见,而且通常是在理想的音频条件下测得。以下是实际准确度的含义、影响因素、对您的录音应该抱持怎样的合理期望,以及如何进行录制以获得近乎完美的转录结果。
行业标准是 字词错误率 (WER)将机器生成的文本与实际所说内容进行比较,并统计三种类型的错误: 替换 (错误的单词) 插入词 (多余的词),以及 删除词 (遗漏的词)。将总数除以所说的单词数量,即为您的 WER(词错误率)。WER 为 5% 表示大约每二十个单词中有一个是错误的,通常会反过来引用为“准确率为 95%”。
人们对 WER 的两个常见误解:首先,它将所有错误都视为同等重要,但在实际应用中,一个错误的姓名、剂量或数量造成的损害远大于一个含糊不清的“嗯,好吧”。其次,公布的 WER 数据来自基准数据集:通常是干净、单人说话者、带有标准口音的音频。您的实际数据几乎完全取决于您的录音质量。
这是最大的影响因素。交通噪声、咖啡馆里的喧闹声、空调声、键盘敲击声和风声都会与人声竞争。现代模型是在嘈杂的音频上进行训练的,并且能够很好地处理稳定的背景嗡嗡声,但响亮或类似语音的噪音(电视、其他对话)会直接破坏单词。
这与噪音密切相关:说话者离笔记本电脑麦克风两米远时,声音听起来会有回音且很小,准确性会急剧下降。一部放在说话者附近的手机比房间另一侧的一台昂贵的麦克风效果更好。
像 Whisper 这样的模型是在数十万小时的多语言音频上进行训练的,因此常见的口音可以很好地转录。非常重的区域性口音、方言和强烈的非母语发音仍然会增加错误率:该模型会将“预期”的最近单词替换进去。
专门的词汇(医学术语、产品名称、人名、缩略词)是错误集中的地方,因为该模型可能从未见过这些词。它会自信地写出一个听起来合理但错误的替代词,这正是为什么校对如此重要的原因。
可以进行轮流对话。人们 同时说话, 这就不好:重叠的语音确实会产生模棱两可的音频,而且所有转录系统都难以处理这种情况。小组讨论和激烈的会议是最具挑战性的常见场景。
严重压缩的音频(低比特率的语音备忘录、电话通话、旧录音)会直接丢弃区分相似辅音的关键频率。削波(录音时声音过大导致波形失真)的情况就更糟了。
| 场景 | 典型结果 |
|---|---|
| 播客/配音,使用高质量麦克风,只有一个说话者 | 优秀:通常有 97% 到 99% 的词语准确;接近可发布的水平 |
| Zoom/Teams 会议,每个人都戴着耳机 | 非常好:预计每页需要进行少量修改,主要是人名 |
| 面试,电话放在安静的房间里的桌子上 | 良好:生成一份可靠的文本稿,检查人名、数字和安静的部分 |
| 讲座,演讲者离录音设备较远 | 可用:主要内容清晰;回声较大的部分音质较差。 |
| 用于处理多人对话,消除杂音和咖啡馆背景噪音。 | 音质一般:预计会出现明显的停顿和说话者混淆的情况;仅供大致了解内容,不宜作为准确引用。 |
即使是一份准确率高达 97% 的 1500 字访谈记录,也可能包含大约 45 个错误的词语,而且这些错误的词语往往是您最关心的名称、数字和技术术语。自动转录的目的是减少错误,而不是完全消除错误;修正 45 个词语只需要五分钟,而手动输入 1500 个带时间戳的词语则需要一个多小时。时间、结构以及 95% 以上的文字都已经为您处理完毕。
回答“它的准确率如何?”最诚实的方法是: 对我来说,?就是用您的实际录音进行测试。 ScribeGrab 使用 our speech model (这是最准确的开源语音识别模型之一),免费使用,没有每日限制,无需注册,并且可以为您提供转录文本以及 SRT 和 VTT 字幕文件, 所有这些都来自一次上传。您的文件在处理完成后会立即删除。
对于清晰、高质量的录音,现代模型通常能正确识别出 95% 到 98% 的词语(词错误率约为 2% 到 5%)。噪音、浓重的口音、声音重叠、专业术语和劣质麦克风会降低准确度:嘈杂的多人语音音频的准确度可能会降至 90% 以下。
标准的准确性指标:替换 + 插入 + 删除,除以所说的单词数。5% 的 WER ≈ 每 20 个单词中出现 1 个错误。数值越低越好。
将麦克风靠近说话者,在安静的房间里进行录音,每次只让一个人说话,确保音频电平适中且没有削波,使用原始文件而不是重新压缩的文件,并在非常短的片段上手动设置语言。
是的,错误主要集中在人名、数字和专业术语等关键词汇上。但修改几十个单词比从头开始输入整个文本要快一个小时甚至更长时间。