アカウント不要。1日の利用制限なし。他のサービスでは、1日に3ファイルまでしか提供せず、「無制限」と謳っています。ここでは、最大60分までのファイルを好きなだけ処理できます。
どんな音声でも MP3 無料で高精度なテキストに変換:ダウンロードしたポッドキャスト、録音された講義、ボイスメモなど。アップロードするだけで数秒以内にトランスクリプトを取得できます。アカウント不要、ウォーターマークなし、分あたりの料金もかかりません。
シンプルなトランスクリプトと字幕はここで作成できます。話者ラベルの追加、音声のミュート処理、翻訳、字幕の焼き込み、90MBを超えるファイルの処理などは、 完全版ツールで利用可能.
今すぐオーディオをテキストに変換 →多くの「無料」の文字起こしツールでは、1日の利用時間に制限を設けたり、有料版にアップグレードするまで出力ファイルに透かしが入ったりします。ScribeGrabは独自のGPUで動作するため、分ごとのクラウド料金や1日の上限はありません。個々のファイルのサイズは最大60分、1.5GBまで対応し、約100言語を自動検出します。また、アップロードされたファイルは処理が完了するとすぐに削除されます。
多くの録音ファイルはMP3形式で保存されるため、ScribeGrabでは変換作業を行わずに直接読み取ることができます。別のファイル形式(WAV、M4A、FLAC、OGG、AACなど)や一般的な動画ファイルも同様に処理できます。詳細については、以下のワークフローをご覧ください。 音声をテキストに変換 は、携帯電話のボイスメモにも対応しています。 オーディオをテキストに変換 完全なリストについては、以下のワークフローを参照してください。
2026年8月21日までの40日間において、「MP3からテキストへの変換」は64回実行され、ScribeGrab全体でのツールの利用回数は1,647回でした。すべてのアップロードが正常に処理されるわけではありません。1,083件のアップロードは、処理開始前に制限を超えたなどの理由で拒否されました。サイト全体の最も多い拒否理由は、ファイルの長さが60分を超えること(155回)であり、ファイルサイズに関しては、「ファイルが大きすぎます(最大1500MB)」というエラーが30回発生しました。別の63件のジョブは、完全に拒否されるのではなく、途中で処理に失敗しました。拒否はモデルがファイルを読み込む前に発生し、失敗は文字起こしのプロセス中に発生します。
明瞭な音声の場合、文字起こしはほぼ完璧に近くなります。強いアクセント、複数の声が重なっている場合、またはノイズが多い録音の場合は、他のツールと同様に処理が難しくなるため、簡単な校正を行ってください。当社のウェブサイトには、詳細な分析を掲載しています。 AIによる音声認識の精度は、実際にどの程度なのか?.
MP3ファイルについて最初に気になるのは、音声認識に適した品質かどうかということです。ほとんどの場合、問題ありません。音声認識システムは、人が聞くのとは異なる方法で音声を処理します。人間の音声に含まれる情報を最大限に活用するために、モデルが音声を処理する前に、まず16kHzモノラルにリサンプリングされます。320kbpsステレオファイルと128kbpsモノラルファイルは、ほぼ同じ結果になります。さらに、64kbpsの音声録音でも、通常は問題なく文字起こしできます。ビットレートを気にする必要はありません。
文字起こしの精度に影響を与えるのは、主に録音環境であり、その重要度が高い順に以下のようになります。 マイクからの距離 (2メートル離れたテーブルに置かれた携帯電話は、どんなコーデックよりも多くのノイズを生み出します) 重なり合った音声, 強い反響 壁が平行な部屋で録音した場合など 一定の背景ノイズ 例えば、エアコン、交通騒音、またはノートパソコンのファンなど。近距離で録音された96kbpsファイルは、広範囲で録音されたロスレスファイルよりも常に優れています。
つまり、改善すべき点は、録音後に調整するのではなく、録音前に行うことです。録音機器を話者に近づけましょう。もし2人が話す場合は、片方の前に置くのではなく、両者の間に置きましょう。ファンの電源を切ってください。すでにファイルがあり、品質が良くない場合でも、文字起こしを実行してみてください。無料で数分で完了し、結果を読むことで、試してみる価値があるかどうかを判断できます。
「音声ファイル」と言えばMP3ファイルを指すことが多いですが、通常はそれだけではありません。別の形式の方が適している場合もあります。複数の形式がある場合は、以下のリストを参照してください。
MP3ファイルをWAV形式に変換してからアップロードしても、ファイルサイズが大きくなるだけで意味がありません。MP3で削除された情報は元に戻らないからです。その手順はスキップしてください。最大 60分 のファイルを一度の処理で実行し、プレーンテキストのトランスクリプトと SRTおよびVTT という形式の字幕ファイルが、同じ処理で生成されます(音声またはビデオをソースとして使用)。
1つのMP3ファイルをアップロードすると、3つのファイルが出力され、すべて同じ処理で生成されます。用途に合わせて最適なファイルを選択してください。
複数の人が話している場合、トランスクリプトには 話者ラベルが追加されます。これは音声自体から解析され、各発言セグメントの特性を測定し、類似するものをグループ化することで決定されるため、正確なものではなく、あくまで推定値です。声が似ている2人の場合、誤って1つの話者としてまとめられてしまう可能性があり、マイクに近づいたり遠ざかったりする1人の話者は、2つに分割されてしまう可能性があります。ラベルは、法廷で誰が何を言ったかを正確に示すものではなく、修正を加えるための最初のステップとして扱ってください。
どのようなツールを使用しても、トランスクリプトはそのままでは公開できません。以下の順序で整理することで、大幅に時間を短縮できます。
上記のいずれよりも時間短縮に役立つのは2つのことである。SRTファイルをテキストの横に開いておく—ある箇所が不明瞭に見える場合、タイムコードがあれば、その部分を音声で確認できるため、推測する必要がない。また、自分で音声を録音する場合は、マイクを発言者に近づけるようにする。机の上に腕の長さだけ離して置いた携帯電話を使用すると、設定でどれだけ調整しても、正確性が損なわれ、これは完全にコントロール可能な唯一の変数である。
はい。1日の上限、1分あたりの料金、透かし、アカウント登録は一切ありません。ファイルサイズは最大60分、1.5GBまでです。
いいえ。MP3ファイルをそのままアップロードしてください。ScribeGrabは、WAV、M4A、FLACなどの形式のファイルも直接読み取ります。
約100種類の言語を自動で検出します。ご自身で言語を選択する必要はありません。
処理後すぐに削除され、結果は45分以内に消去されます。
その他のガイド: ポッドキャストの文字起こし · 講義の文字起こし · YouTube動画の文字起こし · 音声をテキストに変換