Miễn phí, không cần đăng ký, không có hình mờ. Một giờ âm thanh mất khoảng hai phút.
Không có tệp sẵn? Hãy dán một liên kết YouTube vào bên dưới. Bản phụ đề có thể được dịch sang 16 ngôn ngữ.
Dán một Liên kết YouTube và chỉ trong giây lát, bạn sẽ nhận được bản ghi lại — và nếu video đó không có phụ đề, chúng tôi vẫn sẽ tạo ra bản chép lời, đây là điểm mà hầu hết các công cụ khác đều bỏ cuộc. Phỏng vấn, bài giảng, podcast, ghi âm giọng nói: tệp tối đa 60 phút mỗi lần, không cần tài khoản, không có hình mờ.
Bất kỳ định dạng âm thanh hoặc video phổ biến nào. Quá trình chuyển đổi sang văn bản bắt đầu ngay lập tức: không cần tài khoản, không cần email, không giới hạn số lượng mỗi ngày.
Một mô hình nhận dạng giọng nói (Whisper) thực hiện việc chuyển đổi trên GPU của chúng tôi, tự động phát hiện ngôn ngữ và gắn nhãn người đang nói khi có nhiều hơn một giọng nói, thường nhanh hơn rất nhiều so với thời gian thực.
Nhận bản chép lời thuần túy dưới dạng TXT và phụ đề có dấu thời gian dưới dạng SRT và VTT. Bản tải lên của bạn sẽ tự động bị xóa.
Trang này chứa đầy đủ các chức năng của công cụ, không phải là phiên bản dùng thử. Vé không thay đổi quá trình chuyển đổi giọng nói thành văn bản và cũng không cải thiện chất lượng bản ghi — nó chỉ cung cấp thêm các tùy chọn để xử lý bản ghi sau khi hoàn tất Sau đó.
Đây là công cụ hoàn chỉnh, không phải phiên bản dùng thử. Sử dụng cùng một mô hình và tạo ra bản ghi giống như khi sử dụng gói trả phí — không có tính năng nào bị tắt ở đây.
Được xử lý bởi Polar, đối tác thanh toán của chúng tôi — họ sẽ thực hiện việc thanh toán và tính thuế GTGT. Bạn không cần tạo tài khoản ở đây: thông tin đăng nhập của bạn được lưu trữ trên trình duyệt này.
Tạo phụ đề SRT/VTT cho YouTube, Reels và TikTok: giúp nội dung dễ tiếp cận hơn và mở rộng phạm vi người xem, mà không cần trả phí theo phút.
Chuyển đổi các bản ghi âm cuộc phỏng vấn, cuộc họp và bài giảng thành văn bản có thể tìm kiếm, giúp bạn dễ dàng trích dẫn và xem lại, đồng thời phân chia theo người nói để biết ai đã nói gì.
Bản ghi đầy đủ cho mỗi tập để làm tài liệu tham khảo và tối ưu hóa công cụ tìm kiếm: mọi từ trong tập của bạn đều được ghi lại và có thể lập chỉ mục.
Đúng vậy: không cần tạo tài khoản, không có hình mờ, không tính phí theo phút hoặc giới hạn hàng ngày, và công cụ miễn phí này không phải là phiên bản dùng thử — nó không hết hạn và sử dụng cùng một mô hình như các công cụ khác ở đây. Quảng cáo giúp duy trì hoạt động của GPU. Có một tùy chọn bổ sung Gói thuê bao 5€/tháng với tính năng ghi chú cuộc họp, hiển thị tên người nói thực tế, xuất ra file Word và tăng giới hạn sử dụng. Nó mang lại nhiều tiện ích hơn để bạn có thể làm được nhiều việc hơn với bản ghi của mình, chứ không phải tạo ra một bản ghi tốt hơn.
Tệp sẽ được xử lý trên máy chủ riêng của chúng tôi và xóa ngay sau khi hoàn thành; kết quả sẽ bị xóa trong vòng 45 phút. Không có gì được lưu trữ, chia sẻ hoặc sử dụng để huấn luyện mô hình. Xem thêm tại Chính sách bảo mật.
Chúng tôi sử dụng our speech model, một trong những mô hình nhận dạng giọng nói mã nguồn mở tốt nhất. Giọng nói rõ ràng sẽ được chuyển đổi thành văn bản rất chính xác; các giọng địa phương nặng, nhiều người cùng nói, tiếng ồn xung quanh hoặc bản ghi âm kém chất lượng sẽ gây khó khăn hơn cho bất kỳ công cụ nào. Luôn kiểm tra lại nhanh chóng sau khi chuyển đổi.
Có. Khi nó nhận thấy có nhiều hơn một giọng nói, nó sẽ tự động chia bản ghi thành các đoạn hội thoại của từng người nói, tối đa tám người, mà không cần phải bật bất kỳ cài đặt nào. Điều này giúp biến một cuộc phỏng vấn hoặc bản ghi âm cuộc họp trở nên dễ đọc thay vì chỉ là một khối văn bản dài. Các nhãn được ước tính bằng AI, vì vậy đối với các đoạn hội thoại có nhiều giọng nói chồng chéo hoặc giọng nói rất giống nhau, hãy kiểm tra nhanh chúng.
Có chứ. Hãy chọn ô “Tạo thêm một phiên bản đã chỉnh sửa hoặc có phụ đề” trước khi tải lên, bạn sẽ nhận được một tệp thứ hai trong đó tất cả các từ ngữ thô tục đều bị thay thế bằng tiếng bíp, làm im lặng hoặc cắt bỏ — hơn nữa, nếu muốn, công cụ còn loại bỏ những tiếng “ừm” và khoảng lặng kéo dài. Bạn sẽ thấy danh sách đầy đủ kèm theo thời gian hiển thị trước, và có thể giữ lại bất kỳ từ nào. Tìm hiểu thêm về việc loại bỏ các từ ngữ thô tục và loại bỏ các từ đệm.
Khoảng 100 ngôn ngữ, tự động phát hiện (hoặc bạn có thể chọn). Tệp âm thanh và video: MP3, WAV, M4A, FLAC, OGG, MP4, MOV, MKV, WEBM và nhiều hơn nữa, dung lượng tối đa 1.5 GB và thời lượng 60 phút.
Có, hãy tải trực tiếp video lên và tải xuống tệp SRT hoặc VTT. Đặt tệp SRT bên cạnh video của bạn hoặc tải nó lên YouTube dưới dạng chú thích.
Có. Instagram, TikTok, WhatsApp và hầu hết các TV đều không hỗ trợ tệp phụ đề riêng biệt, vì vậy hãy chọn ô “Tạo thêm một phiên bản đã chỉnh sửa hoặc có phụ đề” trước khi tải lên, chọn một trong ba kiểu hiển thị (Cổ điển, Ô vuông hoặc Lớn) và tải xuống tệp MP4 với văn bản được chèn trực tiếp vào hình ảnhKhông cần cài đặt phần mềm chỉnh sửa, không có hình mờ và tệp gốc của bạn sẽ không bị thay đổi. Hướng dẫn chi tiết: Cách thêm phụ đề vào bất kỳ video nào.
Đây là công cụ liên quan của chúng tôi: StemGrab Tách riêng giọng hát, trống, bass và nhạc nền, hoàn toàn miễn phí.
Với bản ghi âm rõ ràng về một người nói tiếng Anh, mô hình có thể nhận đúng khoảng chín mươi tám từ trên mỗi trăm từ — chúng tôi đo được tỷ lệ lỗi là 1,94% đối với giọng nói chuẩn. Ba yếu tố ảnh hưởng lớn nhất: Tiếng ồn lẫn tạp (crosstalk), khi hai người cùng nói chuyện một lúc, vì mô hình phải chọn một trong hai. Khoảng cách từ micro, vì điện thoại ở cuối bàn họp sẽ thu được nhiều tiếng ồn xung quanh hơn là giọng nói. Và từ vựng không phổ biến: tên riêng, thương hiệu, thuật ngữ chuyên ngành và các từ viết tắt được suy đoán dựa trên ngữ cảnh, vì vậy một cái tên mà mô hình chưa từng gặp sẽ được hiểu thành một từ nghe có vẻ giống như vậy. Các giọng địa phương mạnh mẽ được xử lý tốt hơn so với những gì mọi người mong đợi; nhạc nền lại được xử lý kém hơn.
Nhận dạng giọng nói đòi hỏi thời gian sử dụng GPU, và hầu hết các công cụ chuyển đổi văn bản miễn phí đều thuê thời gian đó từ một dịch vụ đám mây cho mỗi phút âm thanh — đây chính là lý do tại sao có giới hạn ba tệp mỗi ngày và hai mươi phút. Chúng tôi sở hữu phần cứng: cùng một card đồ họa được sử dụng cho các công cụ khác của chúng tôi ở Hà Lan, vì vậy việc xử lý thêm một bản ghi chỉ tốn điện chứ không phải trả tiền dịch vụ, và quảng cáo trên trang web sẽ bù đắp chi phí đó. Đó là lý do tại sao mỗi tệp có thể dài tới chín mươi phút và dung lượng hai gigabyte, bạn có thể tải lên bao nhiêu tùy thích mà không cần tài khoản hoặc địa chỉ email.