SCRIBE(转录)GRAB(提取)打开该工具 →

将 MP3 文件转换为文本 免费且准确

无需注册账户。没有每日使用限制。其他工具每天只提供三个文件,却声称是“无限”的。这里的文件时长可达 60 分钟,您可以随时上传,次数不限。

将任何 MP3 内容免费转换为准确的文本:例如,已下载的播客、录制的讲座或语音备忘录。上传文件后,几秒钟内即可获得转录稿,无需注册账户、没有水印、也没有按分钟收费。

纯文本稿和字幕就在这里。发言者标签、静音处理、翻译、嵌入式字幕以及超过 90MB 的文件都可以在完整工具中找到。 完整工具.

现在开始转录音频 →
将任何 MP3 文件直接转换为文本

大多数“免费”转录工具都会限制每天的使用时长,或者在输出文件中添加水印,直到您付费。ScribeGrab 在我们自己的 GPU 上运行 our speech model 模型,因此无需按分钟计费,也没有每日使用上限:单个文件最长可处理 60 分钟和 1.5 GB,自动检测约 100 种语言,并且您的上传内容会在完成后立即删除。

MP3 是大多数录音最终采用的格式,因此 ScribeGrab 可以直接读取它,无需先进行转换。如果您有其他文件呢?WAV、M4A、FLAC、OGG、AAC 以及常见的视频文件都可以以相同的方式使用。请参阅“常规”部分 音频转文本 以获取完整列表。

如何将 MP3 转换为文本
  1. 打开 ScribeGrab,然后点击“打开工具”。
  2. 将您的 MP3 文件拖入(最长 60 分钟 / 1.5 GB)。
  3. 让 our speech model 模型在我们的 GPU 上进行转录。
  4. 下载转录文本为 TXT 格式,如果您需要字幕,还可以下载 SRT/VTT 格式。

转录的准确度如何?

对于清晰的语音,转录结果几乎可以达到完美。对于所有工具来说,强烈的口音、重叠的声音或嘈杂的录音都会增加难度,因此请对这些内容进行快速校对。我们撰写了一篇关于 AI 转录实际准确度的详细分析。.

比您想象的,比特率的影响较小。环境的影响更大。

人们最先询问 MP3 文件的问题是,它是否具有足够高的质量以进行转录。几乎总是可以。语音识别并非像您听的方式那样工作:在模型处理音频之前,音频会被重新采样为 16 kHz 单声道,因为人类语音的信息就存在于这个频率范围内。一个 320 kbps 立体声文件和一个 128 kbps 单声道文件最终会得到几乎相同的结果,即使是 64 kbps 的语音录音通常也能很好地进行转录。比特率不是您应该担心的问题。

真正决定准确度的因素是录音本身,并且按照影响程度从大到小的顺序排列: 与麦克风的距离 (如果将手机放在离麦克风两米远的桌子上,录音效果会比任何音频编码方式都要差), 多人同时说话, 过强的回声 例如在一个空旷、墙壁平行的房间里,以及 持续的背景噪音 比如空调声、交通噪音或笔记本电脑的风扇声。近距离录制的 96 kbps 音频效果总是比远距离录制的高品质无损音频更好。

这意味着真正有用的改进在于你在录音之前所做的准备,而不是之后。将录音设备移动到离说话者更近的位置。如果有多个人在说话,可以将录音设备放在他们中间,而不是放在其中一个人的前面。关掉风扇。如果你已经有了这个文件,而且质量不太好,仍然可以进行转录:这是免费的,只需几分钟,并且通过阅读结果你会学到更多,而不是猜测是否值得尝试。

MP3 或你可能拥有的其他格式

当人们说“音频文件”时,通常指的是 MP3 格式,但它很少是你拥有的唯一版本,有时另一种格式会更好。如果你同时拥有这两种格式,请使用下面的列表。

在上传之前将 MP3 转换为 WAV 并不会带来任何好处,只会使文件变大,因为 MP3 中删除的信息无法恢复。跳过这一步。单个文件时长最多为: 60 分钟 每个文件都经过一次处理,您将获得一份纯文本的转录稿,以及 SRT 和 VTT 字幕文件,所有这些都来自同一批处理,无论来源是音频还是视频。

您将获得的输出结果,以及应该使用哪个文件

输入一个 MP3 文件,输出三个文件,全部来自同一批处理——选择最适合您需求的:

当有多个人说话时,转录文本也会显示 说话人标签这些标签是根据声音本身推断出来的——该工具会测量每个语音片段的特征,并将相似的片段归为一组——因此,这是一种有根据的估计,而不是绝对准确的结果。如果两个人的声音很相似,可能会被合并成一个人;而如果一个人离麦克风时近时远,则可能被分成两个人。将这些标签视为一个初步版本,您稍后会进行修改,而不是将其视为法庭上谁说了什么的完整记录。

以正确的顺序清理文本

无论使用哪种工具生成的转录文本,都不能直接发布。按照这个顺序进行整理,可以节省大量时间:

  1. 首先修正专有名词,使用查找和替换功能。 人名、公司名称、地点和术语是语音模型最容易出错的地方,而且它们总是以相同的方式出错。 一致地 ——同一个名字每次都会被错误地识别为相同的形式。对每个名字进行一次“全部替换”操作,就可以修正二十个实例。
  2. 然后检查句子边界。 标点符号是从停顿和语调中推断出来的,因此,如果说话者声音逐渐消失,则会在不合适的位置出现句号。这只是快速浏览一遍,而不是重写。
  3. 首先,校正说话者标签。在开始编辑文本之前,先确认好说话者的姓名——在结构与音频仍然匹配时进行操作。
  4. 然后再进行润色:删除填充词、精简重复内容、剪掉开头不完整的句子。最后一步执行此操作,因为之前的每一步都更容易在原始文本的基础上进行。有两件事比上述任何一项都能节省更多时间。将 SRT 文件与文本并排打开——当一段文字看起来混乱时,时间码会直接带你到音频中的那一秒,让你听而不是猜测。如果你自己录制音频,请将麦克风靠近说话者:放在桌子上、距离一臂远的手机会比任何设置都降低准确性,而且这是完全由你控制的唯一变量。

常见问题解答

将 MP3 文件转换为文本真的免费吗?

是的。没有每日限制、每分钟收费、水印或账户要求。文件大小可达 60 分钟和 1.5 GB。

我需要先将 MP3 文件进行转换吗?

不需要。直接上传 MP3 文件;ScribeGrab 会直接读取它,以及 WAV、M4A、FLAC 等其他格式的文件。

支持哪些语言?

大约 100 种语言,自动检测。你无需手动选择语言。

我的 MP3 文件会怎样?

处理完成后立即删除,结果会在 45 分钟内清除。

更多指南:

More guides: 将播客内容转录成文字 · 将讲座内容转录成文字 · 将 YouTube 视频内容转录成文字 · 音频转文本