Công cụ này làm gì
Trình tạo robots.txt viết tệp robots.txt cho trình thu thập biết chúng được tải phần nào của trang web. Chọn user-agent cho nhóm quy tắc chính, liệt kê các đường dẫn cần chặn và các ngoại lệ được phép, thêm crawl-delay và một hoặc nhiều URL sitemap nếu muốn, tệp sẽ cập nhật ngay khi bạn nhập.
Thiết lập sẵn xử lý các trường hợp phổ biến chỉ với một cú nhấp: Cho phép tất cả, Chặn tất cả (hữu ích cho trang thử nghiệm) và điểm khởi đầu cho WordPress. Một thiết lập riêng chặn trình thu thập AI chỉ cho mục đích huấn luyện hoặc chặn hoàn toàn, gồm cả tìm kiếm AI và tác nhân của trợ lý, và bạn có thể chặn bất kỳ bot nào khác theo tên, như trình thu thập SEO. Đường dẫn, tên user-agent và URL sitemap đều được kiểm tra, nên quên dấu gạch chéo đầu hay dùng sitemap tương đối sẽ được báo lỗi thay vì âm thầm tạo ra tệp hỏng.
Cách sử dụng
- Bắt đầu từ một thiết lập sẵn hoặc giữ mặc định là cho phép tất cả.
- Trong Đường dẫn bị chặn, liệt kê thư mục hoặc mẫu mà trình thu thập không được vào, phân tách bằng dấu phẩy, ví dụ
/admin/, /cart/, /*?sort=. Dùng Đường dẫn được phép cho các ngoại lệ bên trong. - Thêm URL sitemap để công cụ tìm kiếm tìm thấy mà không cần gửi riêng.
- Chọn cách xử lý trình thu thập AI và thêm các bot khác cần chặn.
- Tải tệp về với tên
robots.txtvà đặt vào thư mục gốc của tên miền để được phục vụ tạihttps://example.com/robots.txt. Mỗi tên miền phụ cần tệp riêng.
Ví dụ
Chặn /admin/ với ngoại lệ cho /admin/public/, thêm sitemap và chặn trình thu thập huấn luyện AI sẽ cho ra:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(Nhóm AI ở đây đã được rút gọn; công cụ liệt kê đầy đủ mọi trình thu thập.) Nhiều dòng User-agent theo sau là các quy tắc tạo thành một nhóm áp dụng cho tất cả, và mỗi trình thu thập chỉ tuân theo nhóm cụ thể nhất có nêu tên nó.
Mẹo
*khớp với mọi chuỗi ký tự và$neo vào cuối URL, nên/*.pdf$chặn mọi tệp PDF.- Khi cả Allow và Disallow cùng khớp, Google áp dụng quy tắc dài nhất (cụ thể nhất).
- Đừng chặn tệp CSS và JavaScript mà trang cần để hiển thị, nếu không công cụ tìm kiếm có thể đánh giá sai trang của bạn.
- Hãy kiểm tra thay đổi bằng báo cáo robots.txt trong Google Search Console trước khi dựa vào chúng.
Câu hỏi thường gặp
› Disallow trong robots.txt có xóa trang khỏi Google không?
Không. Disallow chỉ ngăn các trình thu thập tuân thủ tải một URL, nhưng URL đó vẫn có thể được lập chỉ mục (không có đoạn trích) nếu trang khác liên kết tới. Để giữ trang khỏi kết quả tìm kiếm, hãy cho phép thu thập và dùng thẻ meta robots noindex hoặc tiêu đề X-Robots-Tag.
› Công cụ chặn những trình thu thập AI nào?
Chặn trình thu thập huấn luyện thêm GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot và các bot khác thu thập dữ liệu để huấn luyện mô hình. Chặn mọi bot AI còn thêm các trình lập chỉ mục tìm kiếm AI và tác nhân của trợ lý như OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot và Perplexity-User, điều này có thể khiến trang của bạn không còn được trích dẫn trong câu trả lời của AI.
› Mọi trình thu thập đều tuân theo robots.txt?
Các công cụ tìm kiếm uy tín và các công ty AI lớn cho biết họ tuân thủ, nhưng robots.txt chỉ là quy ước, không phải cơ chế kiểm soát truy cập. Trình cào dữ liệu có thể phớt lờ nó, vì vậy hãy bảo vệ nội dung riêng tư bằng xác thực và dùng quy tắc máy chủ hoặc tường lửa với bot gây hại.
› Crawl-delay có được hỗ trợ không?
Bing, Yandex và một số trình thu thập khác tôn trọng Crawl-delay; Google bỏ qua nó và tự điều chỉnh tốc độ thu thập theo tốc độ phản hồi của máy chủ.