SCRIBEGRAB

Biến bất kỳ tệp âm thanh hoặc video nào thành văn bản và phụ đề

Miễn phí, không cần đăng ký, không có hình mờ. Một giờ âm thanh mất khoảng hai phút.

Không có tệp sẵn? Hãy dán một liên kết YouTube vào bên dưới. Bản phụ đề có thể được dịch sang 16 ngôn ngữ.

hoặc dán một liên kết
Đang tải lên…

Dán một Liên kết YouTube và chỉ trong giây lát, bạn sẽ nhận được bản ghi lại — và nếu video đó không có phụ đề, chúng tôi vẫn sẽ tạo ra bản chép lời, đây là điểm mà hầu hết các công cụ khác đều bỏ cuộc. Phỏng vấn, bài giảng, podcast, ghi âm giọng nói: tệp tối đa 60 phút mỗi lần, không cần tài khoản, không có hình mờ.

Từ bản ghi âm đến bản chép lời

1. Tải lên một tệp

Bất kỳ định dạng âm thanh hoặc video phổ biến nào. Quá trình chuyển đổi sang văn bản bắt đầu ngay lập tức: không cần tài khoản, không cần email, không giới hạn số lượng mỗi ngày.

2. Công cụ sẽ tạo ra bản chép lời

Một mô hình nhận dạng giọng nói (Whisper) thực hiện việc chuyển đổi trên GPU của chúng tôi, tự động phát hiện ngôn ngữ và gắn nhãn người đang nói khi có nhiều hơn một giọng nói, thường nhanh hơn rất nhiều so với thời gian thực.

3. Tải xuống

Nhận bản chép lời thuần túy dưới dạng TXT và phụ đề có dấu thời gian dưới dạng SRT và VTT. Bản tải lên của bạn sẽ tự động bị xóa.

17 giây, không cắt xén: một bản ghi âm được đưa vào và trả lại dưới dạng bản chép lời, với các tệp TXT, SRT và VTT sẵn sàng để tải xuống.
ÂM THANH chuyển đổi sang văn bản transcript.txt 00:00 Chào mừng bạn quay lại kênh của chúng tôi. 00:04 Hôm nay, chúng ta sẽ thử nghiệm ba loại micro giá rẻ.
Nhập giọng nói, xuất bản ghi âm có dấu thời gian rõ ràng: bản ghi sẽ hiển thị dấu thời gian cho từng dòng.

Ba loại bản ghi âm

DÀNH CHO NGƯỜI SÁNG TẠO NỘI DUNG

Phụ đề video

Tạo phụ đề SRT/VTT cho YouTube, Reels và TikTok: giúp nội dung dễ tiếp cận hơn và mở rộng phạm vi người xem, mà không cần trả phí theo phút.

CHO CÔNG VIỆC VÀ HỌC TẬP

Các cuộc phỏng vấn & bài giảng

Chuyển đổi các bản ghi âm cuộc phỏng vấn, cuộc họp và bài giảng thành văn bản có thể tìm kiếm, giúp bạn dễ dàng trích dẫn và xem lại, đồng thời phân chia theo người nói để biết ai đã nói gì.

CHO PODCAST

Ghi chú chương trình

Bản ghi đầy đủ cho mỗi tập để làm tài liệu tham khảo và tối ưu hóa công cụ tìm kiếm: mọi từ trong tập của bạn đều được ghi lại và có thể lập chỉ mục.

Các câu hỏi về việc chuyển đổi giọng nói thành văn bản

Nó thực sự miễn phí chứ?

Đúng vậy: không cần tạo tài khoản, không có hình mờ, không tính phí theo phút hoặc giới hạn hàng ngày, và công cụ miễn phí này không phải là phiên bản dùng thử — nó không hết hạn và sử dụng cùng một mô hình như các công cụ khác ở đây. Quảng cáo giúp duy trì hoạt động của GPU. Có một tùy chọn bổ sung Gói thuê bao 5€/tháng với tính năng ghi chú cuộc họp, hiển thị tên người nói thực tế, xuất ra file Word và tăng giới hạn sử dụng. Nó mang lại nhiều tiện ích hơn để bạn có thể làm được nhiều việc hơn với bản ghi của mình, chứ không phải tạo ra một bản ghi tốt hơn.

Tệp của tôi sẽ được xử lý như thế nào?

Tệp sẽ được xử lý trên máy chủ riêng của chúng tôi và xóa ngay sau khi hoàn thành; kết quả sẽ bị xóa trong vòng 45 phút. Không có gì được lưu trữ, chia sẻ hoặc sử dụng để huấn luyện mô hình. Xem thêm tại Chính sách bảo mật.

Độ chính xác của nó như thế nào?

Chúng tôi sử dụng our speech model, một trong những mô hình nhận dạng giọng nói mã nguồn mở tốt nhất. Giọng nói rõ ràng sẽ được chuyển đổi thành văn bản rất chính xác; các giọng địa phương nặng, nhiều người cùng nói, tiếng ồn xung quanh hoặc bản ghi âm kém chất lượng sẽ gây khó khăn hơn cho bất kỳ công cụ nào. Luôn kiểm tra lại nhanh chóng sau khi chuyển đổi.

Nó có hiển thị ai đang nói không?

Có. Khi nó nhận thấy có nhiều hơn một giọng nói, nó sẽ tự động chia bản ghi thành các đoạn hội thoại của từng người nói, tối đa tám người, mà không cần phải bật bất kỳ cài đặt nào. Điều này giúp biến một cuộc phỏng vấn hoặc bản ghi âm cuộc họp trở nên dễ đọc thay vì chỉ là một khối văn bản dài. Các nhãn được ước tính bằng AI, vì vậy đối với các đoạn hội thoại có nhiều giọng nói chồng chéo hoặc giọng nói rất giống nhau, hãy kiểm tra nhanh chúng.

Công cụ này có thể tự động loại bỏ những từ ngữ thô tục không?

Có chứ. Hãy chọn ô “Tạo thêm một phiên bản đã chỉnh sửa hoặc có phụ đề” trước khi tải lên, bạn sẽ nhận được một tệp thứ hai trong đó tất cả các từ ngữ thô tục đều bị thay thế bằng tiếng bíp, làm im lặng hoặc cắt bỏ — hơn nữa, nếu muốn, công cụ còn loại bỏ những tiếng “ừm” và khoảng lặng kéo dài. Bạn sẽ thấy danh sách đầy đủ kèm theo thời gian hiển thị trước, và có thể giữ lại bất kỳ từ nào. Tìm hiểu thêm về việc loại bỏ các từ ngữ thô tụcloại bỏ các từ đệm.

Công cụ hỗ trợ những ngôn ngữ và định dạng tệp nào?

Khoảng 100 ngôn ngữ, tự động phát hiện (hoặc bạn có thể chọn). Tệp âm thanh và video: MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM và nhiều hơn nữa, dung lượng tối đa 1.5 GB và thời lượng 60 phút.

Tôi có thể tạo phụ đề cho một video không?

Có, hãy tải trực tiếp video lên và tải xuống tệp SRT hoặc VTT. Đặt tệp SRT bên cạnh video của bạn hoặc tải nó lên YouTube dưới dạng chú thích.

Bạn có thể chèn phụ đề vào chính video không?

Có. Instagram, TikTok, WhatsApp và hầu hết các TV đều không hỗ trợ tệp phụ đề riêng biệt, vì vậy hãy chọn ô “Tạo thêm một phiên bản đã chỉnh sửa hoặc có phụ đề” trước khi tải lên, chọn một trong ba kiểu hiển thị (Cổ điển, Ô vuông hoặc Lớn) và tải xuống tệp MP4 với văn bản được chèn trực tiếp vào hình ảnhKhông cần cài đặt phần mềm chỉnh sửa, không có hình mờ và tệp gốc của bạn sẽ không bị thay đổi. Hướng dẫn chi tiết: Cách thêm phụ đề vào bất kỳ video nào.

Bạn muốn tách một bài hát thành các phần riêng biệt thay vì vậy?

Đây là công cụ liên quan của chúng tôi: StemGrab Tách riêng giọng hát, trống, bass và nhạc nền, hoàn toàn miễn phí.

Độ chính xác giảm ở đâu?

Với bản ghi âm rõ ràng về một người nói tiếng Anh, mô hình có thể nhận đúng khoảng chín mươi tám từ trên mỗi trăm từ — chúng tôi đo được tỷ lệ lỗi là 1,94% đối với giọng nói chuẩn. Ba yếu tố ảnh hưởng lớn nhất: Tiếng ồn lẫn tạp (crosstalk), khi hai người cùng nói chuyện một lúc, vì mô hình phải chọn một trong hai. Khoảng cách từ micro, vì điện thoại ở cuối bàn họp sẽ thu được nhiều tiếng ồn xung quanh hơn là giọng nói. Và từ vựng không phổ biến: tên riêng, thương hiệu, thuật ngữ chuyên ngành và các từ viết tắt được suy đoán dựa trên ngữ cảnh, vì vậy một cái tên mà mô hình chưa từng gặp sẽ được hiểu thành một từ nghe có vẻ giống như vậy. Các giọng địa phương mạnh mẽ được xử lý tốt hơn so với những gì mọi người mong đợi; nhạc nền lại được xử lý kém hơn.

Tại sao không có giới hạn hàng ngày trong khi các công cụ chuyển đổi văn bản miễn phí khác lại đặt ra giới hạn?

Nhận dạng giọng nói đòi hỏi thời gian sử dụng GPU, và hầu hết các công cụ chuyển đổi văn bản miễn phí đều thuê thời gian đó từ một dịch vụ đám mây cho mỗi phút âm thanh — đây chính là lý do tại sao có giới hạn ba tệp mỗi ngày và hai mươi phút. Chúng tôi sở hữu phần cứng: cùng một card đồ họa được sử dụng cho các công cụ khác của chúng tôi ở Hà Lan, vì vậy việc xử lý thêm một bản ghi chỉ tốn điện chứ không phải trả tiền dịch vụ, và quảng cáo trên trang web sẽ bù đắp chi phí đó. Đó là lý do tại sao mỗi tệp có thể dài tới chín mươi phút và dung lượng hai gigabyte, bạn có thể tải lên bao nhiêu tùy thích mà không cần tài khoản hoặc địa chỉ email.

Các cách sử dụng phổ biến của ScribeGrab