Giải mã trình thu thập dữ liệu AI - và nên đưa gì vào robots.txt
Một nhóm nhỏ trình thu thập dữ liệu (crawler) có danh tính rõ ràng giờ đây quyết định trang web của bạn có tồn tại trong các câu trả lời AI hay không. Mỗi bot phục vụ một mục đích khác nhau - huấn luyện, tìm kiếm thời gian thực, hay duyệt web bằng tác nhân - và mỗi bot có thể được cho phép hoặc từ chối độc lập trong robots.txt. Đây là tấm bản đồ thực dụng.
Những trình thu thập đáng quan tâm
| User-agent | Operator | Cấp dữ liệu cho gì |
|---|---|---|
GPTBot | OpenAI | Huấn luyện mô hình và kho dữ liệu duyệt web của ChatGPT |
OAI-SearchBot | OpenAI | Kết quả tìm kiếm của ChatGPT (trích dẫn trực tiếp) |
ClaudeBot | Anthropic | Huấn luyện và truy xuất thông tin cho Claude |
Claude-User | Anthropic | Các lượt truy xuất thay mặt người dùng/tác nhân Claude |
PerplexityBot | Perplexity | Chỉ mục của công cụ trả lời Perplexity (nguồn được trích dẫn) |
Google-Extended | Huấn luyện/grounding cho Gemini - tách biệt với xếp hạng của Googlebot | |
CCBot | Common Crawl | Kho dữ liệu web mở được nhiều dự án nghiên cứu/AI sử dụng |
Bytespider | ByteDance | Huấn luyện mô hình |
Baiduspider | Baidu | Chỉ mục tìm kiếm Baidu (cánh cửa chính vào tìm kiếm Trung Quốc) |
PetalBot | Huawei | Chỉ mục Petal Search và các tính năng AI |
Quyết định một cách chủ đích, đừng để mặc định
Ba chính sách nhất quán - hãy chủ động chọn một:
1. Mở (để được tìm thấy trên các bề mặt AI)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Tìm kiếm: có, huấn luyện: không
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Đóng
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Dù bạn chọn gì: hãy giữ dòng
Sitemap: trong robots.txt, và nhớ rằng robots.txt trống hoặc không tồn tại có nghĩa là "cho phép tất cả" đối với các trình thu thập tuân thủ - một quyết định do bỏ mặc.Điều này ảnh hưởng đến bản kiểm định của bạn thế nào
Bản kiểm định 30 hạng mục của chúng tôi đọc robots.txt của bạn và báo cáo liệu trình thu thập dữ liệu AI có quy tắc tường minh hay không - im lặng bị chấm điểm thấp hơn một chính sách chủ đích, bất kể bạn chọn hướng nào, vì tác nhân và các nhà vận hành chúng đánh giá cao sự rõ ràng.
Kiểm tra robots.txt và mức độ sẵn sàng đầy đủ của bạn ngay
Câu hỏi thường gặp
- Tôi có nên chặn GPTBot không?
- Đây là quyết định kinh doanh, không phải mặc định kỹ thuật. Chặn nghĩa là loại nội dung của bạn khỏi các câu trả lời thời ChatGPT và dữ liệu huấn luyện tương lai; cho phép nghĩa là đánh đổi nội dung lấy sự hiện diện trên các bề mặt AI. Với phần lớn doanh nghiệp muốn được tìm thấy và trích dẫn, cho phép các trình thu thập phục vụ tìm kiếm/tác nhân là lựa chọn thực dụng.
- Chặn Google-Extended có ảnh hưởng thứ hạng Google của tôi không?
- Không. Google-Extended chỉ kiểm soát việc dùng nội dung của bạn cho huấn luyện và grounding của Gemini; việc lập chỉ mục và xếp hạng thông thường của Googlebot không bị ảnh hưởng.
- Trình thu thập dữ liệu AI có tôn trọng robots.txt không?
- Các trình thu thập lớn có danh tính rõ ràng (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) cam kết công khai tôn trọng robots.txt. Các trình cào dữ liệu vô danh thì có thể không - robots.txt là tín hiệu chính sách, không phải cơ chế cưỡng chế.