SCRIBEGRAB

あらゆる音声や動画を テキストと字幕に変換

無料、アカウント登録不要、透かしなし。1時間の音声の処理には約 2分かかります.

ファイルがない場合は、以下のYouTubeリンクを貼り付けてください。 YouTubeリンク 字幕は16か国語に翻訳できます。

または、リンクを貼り付けます。
アップロード中…

YouTubeの リンクを貼り付けてください。 数秒で結果が返ってきます。また、動画に字幕がない場合でも自動的に文字起こしを行います。他のツールでは難しい処理です。インタビュー、講義、ポッドキャスト、ボイスメモなど、1ファイルあたり最大90分まで対応。アカウント登録や透かしの挿入は不要です。

音声からテキストへ

1. ファイルをドラッグ&ドロップ

一般的な音声または動画形式に対応。アップロード後すぐに文字起こしが開始されます。アカウント登録、メールアドレス登録、1日の上限回数制限はありません。

2. テキストに変換

音声認識モデル(Whisper)を使用して、当社のGPU上で文字起こしを行います。言語を自動的に検出し、複数の音声が含まれる場合は誰が話しているかを識別します。通常、リアルタイムよりもはるかに高速です。

3. ダウンロード

テキスト形式の文字起こしファイル(TXT)、時間コード付き字幕ファイル(SRTおよびVTT)を入手できます。アップロードされたファイルは自動的に削除されます。

17秒、編集なし:録音ファイルをアップロードすると、テキスト形式の文字起こしファイルが生成され、TXT、SRT、VTT形式でダウンロードできるようになります。
音声 文字起こし transcript.txt 00:00 チャンネルへようこそ。 00:04 今日は、3つの 低価格マイクをテストします。
音声を読み込むと、タイムスタンプ付きの整理されたテキストが出力されます。トランスクリプトには、各行にタイムスタンプが記録されます。

3種類の録音形式

クリエイター向け

動画の字幕

YouTube、Reels、TikTokで使用できるSRT/VTT形式の字幕を作成。分単位での料金なしで、アクセシビリティとリーチを向上させます。

仕事や学習に

インタビューや講義

録音されたインタビュー、会議、講義を検索可能なテキストに変換し、引用したり内容を確認したりできます。話者ごとに分割することで、誰が何を言ったのかを簡単に確認できます。

ポッドキャスト向け

番組ノート

各エピソードの完全な文字起こしを提供。番組ノートやSEO対策に活用できます。発言されたすべての言葉をインデックス化します。

文字起こしに関する質問

本当に無料ですか?

はい。アカウント登録不要、透かしなし、1分あたりの料金や日々の利用制限もありません。また、この無料ツールは試用版ではなく、有効期限もなく、他の機能と同じモデルで動作します。広告収入がGPUの稼働を支えています。オプションとして、 月額5ユーロのプラン があります。会議の議事録、実際の話し手の名前表示、Word形式でのエクスポート、利用上限の引き上げなどが可能です。これにより、より多くの機能をご利用いただけます。 文字起こしでできること より優れた文字起こしを提供するのではなく、文字起こしの活用方法を広げます。

ファイルはどうなりますか?

独自のサーバーで処理され、完了後すぐに削除されます。結果は45分以内に消去されます。ファイルは保存、共有、またはトレーニングに使用されることはありません。詳細は、 プライバシーポリシー.

どれくらい正確ですか?

our speech modelを使用しており、これは最高のオープンソース音声認識モデルの1つです。明瞭な発話であれば非常に正確に文字起こしできますが、強いアクセント、複数の声が重なる場合、バックグラウンドノイズ、または録音状態が悪い場合は、どのツールでも難しくなります。必ず最後に内容を確認してください。

誰が話しているか表示されますか?

はい。複数の声が含まれている場合、最大8人まで自動的に発言者を区別して文字起こしします。特別な設定は必要ありません。これにより、インタビューや会議の録音が、単一の長いテキストブロックではなく、読みやすい形式で表示されます。ラベルはAIによって推定されるため、複数の声が重なる場合や非常に似た声の場合には、内容を簡単に確認してください。

汚い言葉を検知して音声を消したりできますか?

はい。ファイルをアップロードする前に「クリーン版または字幕付きバージョンも作成」にチェックを入れると、すべての汚い言葉が 音を消されたり、ミュートされたり、カットされたファイルがもう一つ生成されます。 さらに、必要に応じて、「えー」のような間投詞や長い沈黙も処理できます。タイムスタンプ付きの完全なリストが表示され、どの単語を残すか選択できます。詳細は 汚い言葉を検知して音声を消す機能について および 不要な間投詞を除去する機能について.

対応言語とファイル形式は?

約100の言語に対応しており、自動で検出(または手動で選択)します。対応オーディオ/ビデオ形式:MP3、WAV、M4A、FLAC、OGG、MP4、MOV、MKV、WEBMなど。最大1.5GB、最長90分まで。

ビデオに字幕を追加できますか?

はい。ビデオを直接アップロードし、SRTまたはVTTファイルをダウンロードしてください。SRTファイルをビデオファイルと一緒に配置するか、YouTubeにキャプションとしてアップロードします。

字幕をビデオ自体に埋め込むことはできますか?

はい。Instagram、TikTok、WhatsAppなどのプラットフォームやほとんどのテレビは、別の字幕ファイルを認識しないため、ファイルをアップロードする前に「クリーン版または字幕付きバージョンも作成」にチェックを入れ、3つのスタイル(クラシック、ボックス、大)から選択して、テキストが ビデオに焼き付けられたMP4ファイルをダウンロードしてください。編集ソフトのインストールやウォーターマークは不要で、元のファイルはそのままです。詳細なガイドはこちら: どんな動画にも字幕を追加する方法.

曲をパートごとに分割したい場合は?

こちらが関連ツールです。 StemGrab ボーカル、ドラム、ベース、インストゥルメンタルを分離します。こちらも無料で利用できます。

どこで精度が低下するのでしょうか?

一人の人が英語を話すクリアな録音の場合、モデルは約100語のうち98語を正しく認識します。クリーンな音声では、約1.94%の単語エラーが発生しました。最も影響を受けるのは以下の3点です。まず、2人が同時に話し合うクロスノイズ。モデルはどちらか一方を選択しなければならないためです。次に、マイクからの距離。会議テーブルの奥に置かれた携帯電話は、声よりも周囲の音を拾いやすくなります。そして、珍しい語彙。名前、ブランド、専門用語、略語などは文脈から推測されるため、モデルが一度も見たことのない苗字は、単に似たような音として出力されます。強いアクセントは、多くの人が予想するよりも適切に処理されます。一方、バックグラウンドミュージックの処理はそれほど良くありません。

他の無料文字起こしツールと異なり、1日の利用制限がないのはなぜですか?

音声認識にはGPU時間が必要であり、ほとんどの無料文字起こしツールは、クラウドサービスからオーディオ1分あたりでその時間をレンタルします。それが、1日に3ファイルまで、20分までの制限を設けている理由です。当社はハードウェアを所有しています。同じグラフィックカードがオランダにある他のツールでも使用されているため、追加の録音には請求書ではなく電気代がかかります。ページの広告でその費用を賄っています。そのため、ファイルのサイズは最大90分、1.5GBまでで、アカウントやメールアドレスなしで好きなだけ利用できます。

ScribeGrabの一般的な使い方