Tạo robots.txt
Tạo file robots.txt hợp lệ để báo cho các bot công cụ tìm kiếm biết đường dẫn nào được phép hoặc không được phép truy cập, đồng thời chỉ đến sitemap của bạn. Mọi thứ chạy ngay trong trình duyệt và kết quả cập nhật trực tiếp khi bạn gõ.
Các bước sử dụng
- (Tùy chọn) Trong thẻ Mẫu nhanh, bấm Cho phép tất cả, Chặn tất cả hoặc WordPress để bắt đầu từ một cấu hình phổ biến.
- Trong Rule group 1, đặt User-agent (
*cho mọi bot, hoặc một bot cụ thể nhưGooglebot/Bingbot). - Điền các đường dẫn vào Disallow và Allow — mỗi dòng một đường dẫn (ví dụ
/admin/,/public/), và tùy chọn đặt Crawl-delay theo giây. - Bấm Thêm nhóm luật để tạo nhóm quy tắc riêng cho các bot khác, hoặc dùng biểu tượng xóa trên một nhóm để loại bỏ nó.
- Nhập các Sitemap URL (mỗi dòng một địa chỉ) trong thẻ sitemap.
- Xem trước nội dung
robots.txtđược tạo, rồi bấm Sao chép hoặc Tải xuống để lưu file.
Mẹo
- Đặt file
robots.txtđã tải xuống ở thư mục gốc của tên miền (ví dụhttps://example.com/robots.txt) — nó chỉ có tác dụng ở đó. - Nếu để trống cả Allow và Disallow của một nhóm, file sẽ xuất ra
Disallow:(quy tắc rỗng), nghĩa là "cho phép mọi thứ" đối với user-agent đó. - Thêm một nhóm quy tắc riêng cho mỗi bot khi bạn cần quy tắc khác nhau cho từng crawler, mỗi nhóm có User-agent riêng.
Câu hỏi thường gặp
robots.txt có thực sự chặn bot truy cập trang của tôi không?
Không. Đây chỉ là một yêu cầu mà các crawler tuân thủ tốt sẽ tôn trọng, chứ không phải cơ chế kiểm soát truy cập bắt buộc. Muốn ẩn hoàn toàn một trang, hãy dùng xác thực đăng nhập hoặc chỉ thị noindex.
Crawl-delay dùng để làm gì?
Nó yêu cầu crawler chờ số giây nhất định giữa các lần truy cập. Google bỏ qua chỉ thị này, nhưng một số bot như Bing có tuân theo — cứ để trống nếu bạn không cần.
Dữ liệu của tôi có bị tải lên đâu không?
Không. File được tạo hoàn toàn trong trình duyệt, nên không có nội dung nào bạn gõ được gửi lên máy chủ.