Trích Xuất Văn Bản
Lấy toàn bộ văn bản có thể chọn được từ một file PDF, theo từng trang, rồi lưu thành file .txt thuần. Dùng khi bạn cần sao chép, tìm kiếm hoặc tái sử dụng nội dung trong PDF thay vì gõ lại.
Các bước sử dụng
- Kéo và thả file PDF vào vùng tải lên, hoặc bấm vào để chọn file (chỉ chấp nhận file
.pdf). - Nếu PDF được đặt mật khẩu, hãy nhập mật khẩu khi hộp thoại mở khóa hiện ra.
- Theo dõi thanh tiến trình khi từng trang được xử lý; văn bản trích xuất sẽ hiện trong ô văn bản chỉ đọc, kèm dấu phân cách
----- Page N -----trước mỗi trang. - Bấm Sao chép để chép toàn bộ vào clipboard, hoặc bấm nút .txt để tải văn bản về dưới dạng file đặt tên theo PDF gốc.
Mẹo
- Mọi xử lý diễn ra ngay trong trình duyệt của bạn, nên file PDF không hề được tải lên máy chủ.
- Dấu phân cách theo trang giúp bạn dễ dàng tìm đến nội dung của một trang cụ thể trong file xuất ra.
- Nếu chỉ cần một phần tài liệu, hãy sao chép toàn bộ văn bản trước rồi cắt bớt trong trình soạn thảo của bạn.
Câu hỏi thường gặp
Vì sao báo "No selectable text found" (Không tìm thấy văn bản)?
Nhiều khả năng PDF chỉ là ảnh chụp/quét của chữ chứ không phải ký tự thật. Công cụ này chỉ đọc văn bản được nhúng sẵn, nên tài liệu quét cần dùng OCR (nhận dạng ký tự quang học) trước.
Có giữ nguyên định dạng, cột hay bảng ban đầu không?
Không. Công cụ trích xuất luồng văn bản thô theo từng trang, nên bố cục phức tạp, cột và bảng có thể bị sắp xếp lại hoặc dàn phẳng.
File tải về được đặt tên như thế nào?
Nó dùng lại tên của PDF gốc và đổi phần mở rộng thành .txt (ví dụ report.pdf thành report.txt).