OCR Ảnh/PDF Sang Text
Nhận dạng và trích xuất chữ từ ảnh hoặc PDF scan với hơn 10 ngôn ngữ. Hữu ích khi bạn cần biến một ảnh chụp màn hình, ảnh chụp tài liệu hay PDF scan trở lại thành văn bản có thể sửa và sao chép.
Các bước sử dụng
- Kéo & thả hoặc bấm vào vùng tải lên để thêm ảnh (JPG, PNG...) hoặc PDF. Nếu PDF được đặt mật khẩu, bạn sẽ được yêu cầu nhập mật khẩu trước.
- Chọn Ngôn ngữ của văn bản trong danh sách. Mặc định là Tiếng Việt + English; danh sách có thể tìm kiếm và bao gồm cả tiếng Trung, Nhật, Hàn, Pháp, Đức, Tây Ban Nha, Nga và nhiều ngôn ngữ khác.
- Bấm Trích xuất chữ. Lần chạy đầu tiên sẽ tải dữ liệu ngôn ngữ từ CDN nên có thể mất một chút thời gian.
- Theo dõi thanh tiến trình — PDF được xử lý theo từng trang, và mỗi trang được đánh dấu trong kết quả.
- Xem lại hoặc chỉnh sửa văn bản đã trích xuất ngay trong ô kết quả, rồi dùng Sao chép hoặc Lưu .txt để giữ lại.
Mẹo
- Chọn ngôn ngữ khớp với tài liệu. Với nội dung lẫn tiếng Việt và tiếng Anh, hãy dùng Tiếng Việt + English để có độ chính xác tốt nhất.
- Ảnh scan độ phân giải cao, đủ sáng và không bị nghiêng sẽ cho kết quả sạch hơn nhiều — OCR khó nhận dạng ảnh mờ hoặc chụp lệch.
- Ô kết quả có thể chỉnh sửa hoàn toàn, nên bạn có thể sửa các ký tự bị nhận nhầm trước khi sao chép hoặc lưu file .txt.
Câu hỏi thường gặp
File của tôi có bị tải lên máy chủ không?
Không. Chỉ có dữ liệu ngôn ngữ được tải một lần từ CDN trong lần dùng đầu tiên; toàn bộ việc xử lý ảnh/PDF và nhận dạng chữ đều diễn ra ngay trên trình duyệt của bạn.
Tại sao OCR lại lỗi hoặc bị treo?
Nguyên nhân phổ biến nhất là không có internet trong lần chạy đầu tiên, khi dữ liệu ngôn ngữ vẫn cần được tải về. Hãy kiểm tra kết nối và thử lại — những lần chạy sau với cùng ngôn ngữ có thể hoạt động ngoại tuyến.
Có đọc được PDF nhiều trang không?
Có. Từng trang sẽ được dựng ảnh và nhận dạng lần lượt, và kết quả sẽ ngăn cách mỗi trang bằng dòng tiêu đề --- Page n/t --- để bạn dễ phân biệt.