Tạo Phụ Đề Tự Động
Chuyển lời nói trong file âm thanh hoặc video thành phụ đề, chỉnh lại thời điểm và câu chữ rồi lưu ra SRT hoặc WebVTT. Model nhận dạng giọng nói chạy ngay trong trình duyệt — file của bạn không rời khỏi thiết bị — nên lần chạy đầu của mỗi model phải tải model đó về.
Các bước sử dụng
- Kéo file vào ô Bấm hoặc kéo-thả file âm thanh hoặc video vào đây trong thẻ File âm thanh hoặc video. File hiện ra trong một trình phát mà bạn có thể tua trong lúc làm việc.
- Trong thẻ Tùy chọn tạo phụ đề, chọn Model. Ba mức Nhanh, Tốt hơn và Tốt nhất đánh đổi độ chính xác lấy dung lượng tải về, và con số ghi trên mỗi nút là số thật cho nền tảng mà trình duyệt của bạn sẽ dùng: khoảng 142 MB, 299 MB và 759 MB với WebGPU, hoặc 77 MB, 249 MB và 1085 MB khi chạy bằng CPU. Tốt nhất đòi hỏi WebGPU và bị chặn kèm cảnh báo trên trình duyệt không có.
- Đặt Ngôn ngữ nói. Có tùy chọn Tự động nhận diện, nhưng chỉ rõ ngôn ngữ vẫn đáng tin hơn — nhất là với bản ghi dài hoặc nhỏ tiếng.
- Chọn Tác vụ: Ghi nguyên văn giữ nguyên ngôn ngữ gốc, còn Dịch sang tiếng Anh tạo phụ đề tiếng Anh từ ngôn ngữ được hỗ trợ bất kỳ.
- Chọn Lưu dạng — SRT hoặc WebVTT.
- Bấm Tạo phụ đề. Thanh tiến trình báo từng giai đoạn: Đang đọc âm thanh…, Đang tách track âm thanh…, Đang tải model…, rồi Đang nhận dạng… phần {i}/{n}. Nút Huỷ dừng lại ở ranh giới phần kế tiếp.
- Soát lại bảng trong thẻ Phụ đề. Mọi ô Bắt đầu, Kết thúc và Nội dung đều sửa được, và nút phát nhỏ ở mỗi dòng đưa trình phát nhảy tới đúng câu đó.
- Bấm Sao chép hoặc Tải xuống .srt / .vtt để lấy phụ đề về. Các chỉnh sửa của bạn được giữ nguyên trong file xuất ra.
Mẹo
- Ngôn ngữ chỉ được xác định một lần, từ 30 giây đầu, rồi giữ nguyên cho cả file. Đây là chủ ý: nếu để mặc, model sẽ tự quyết lại ở từng phần và một đoạn nhỏ tiếng có thể làm nó đổi ngôn ngữ giữa chừng.
- File dài được cắt thành các phần 120 giây với 5 giây gối nhau, và mỗi phần sở hữu một đoạn thời gian riêng biệt. Nhờ vậy thanh tiến trình và nút Huỷ mới thực sự có ý nghĩa với file dài, và không từ nào bị lặp lại ở chỗ nối.
- Model chỉ tải một lần cho mỗi phiên và được trình duyệt lưu đệm, nên lần chạy thứ hai với cùng model sẽ vào thẳng phần nhận dạng.
- Những container mà trình duyệt không giải mã được sẽ được chuyển đổi bằng ffmpeg trước — đó là một lần tải khoảng 25 MB nữa ngoài model, và chỉ xảy ra với những file như vậy.
- Thẻ cam Mốc thời gian theo cụm nghĩa là checkpoint đang dùng không căn được từng từ, nên mốc thời gian bám theo cả cụm. Nội dung vẫn đúng, chỉ là mốc thời gian thô hơn.
- Mốc thời gian bạn gõ vào mà không đọc được sẽ bị từ chối và ô tự quay về giá trị cũ, nên một lỗi gõ không bao giờ âm thầm làm hỏng câu phụ đề.
Câu hỏi thường gặp
File âm thanh hoặc video của tôi có bị tải lên không?
Không. Model được tải về trình duyệt của bạn và file được xử lý ngay tại đó. Không có thông tin nào về file được gửi đi đâu cả.
Vì sao lần chạy đầu tiên chậm như vậy?
Vì nó bao gồm cả việc tải model. Hãy để ý dòng trạng thái Đang tải model… — tải xong rồi thì model đó được dùng lại cho suốt phiên làm việc.
Nên chọn model nào?
Hãy bắt đầu với Nhanh. Đây là bản nhẹ nhất và thường đã đủ tốt với giọng nói rõ ràng. Lên Tốt hơn khi có giọng vùng miền, tiếng ồn nền hoặc từ chuyên ngành, và chỉ dùng Tốt nhất nếu bạn có WebGPU và chấp nhận chờ tải 759 MB.
Không ra kết quả gì, trang báo không nhận ra lời nói nào.
Hoặc file không có tiếng nói, hoặc phần tiếng quá nhỏ và quá ồn so với các model nhỏ. Hãy thử chỉ rõ Ngôn ngữ nói và nâng lên một bậc model.
Tôi sửa một dòng sai mà không phải chạy lại toàn bộ được không?
Được. Sửa thẳng nội dung câu hoặc mốc bắt đầu/kết thúc ngay trong bảng; cả nút tải xuống lẫn nút sao chép đều dùng đúng những gì đang hiển thị.