AI 爬虫详解:robots.txt 该写什么
如今,几个具名爬虫决定着你的网站是否存在于 AI 答案之中。它们各有用途(训练、实时搜索或智能体浏览),并且都可以在 robots.txt 中单独放行或拒绝。这里是一份实用地图。
值得关注的爬虫
| User-agent | 运营方 | 供给什么 |
|---|---|---|
GPTBot | OpenAI | 模型训练与 ChatGPT 浏览语料 |
OAI-SearchBot | OpenAI | ChatGPT 搜索结果(实时引用) |
ClaudeBot | Anthropic | Claude 的训练与检索 |
Claude-User | Anthropic | 代表 Claude 用户/智能体发起的抓取 |
PerplexityBot | Perplexity | Perplexity 答案引擎索引(被引用来源) |
Google-Extended | Gemini 的训练与作答依据,与 Googlebot 排名相互独立 | |
CCBot | Common Crawl | 众多研究/AI 项目使用的开放网络语料 |
Bytespider | 字节跳动 | 模型训练 |
Baiduspider | 百度 | 百度搜索索引(通往中文搜索的主要门户) |
PetalBot | 华为 | Petal Search 索引与 AI 功能 |
有意识地决定,而不是默认放任
三套完整的策略,请有意识地选择一套:
1. 开放(让 AI 界面能找到你)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. 允许搜索,拒绝训练
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. 封闭
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
无论你选哪一套:请在 robots.txt 中保留
Sitemap: 行,并记住空的或缺失的 robots.txt 对合规爬虫来说意味着「全部允许」,这本身就是一个因不作为而作出的决定。这如何影响你的审计
我们的 30 项检查审计会读取你的 robots.txt,并报告 AI 爬虫是否有明确规则。无论你选择哪个方向,沉默的得分都低于明确的策略,因为智能体及其运营方都会奖励清晰。
常见问题
- 我应该屏蔽 GPTBot 吗?
- 这是商业决策,不是默认的技术选项。屏蔽会让你的内容从 ChatGPT 时代的答案和未来的训练中消失;放行则以内容换取在 AI 界面中的曝光。对多数希望被找到、被引用的企业来说,放行搜索/智能体类爬虫是务实的选择。
- 屏蔽 Google-Extended 会影响我的 Google 排名吗?
- 不会。Google-Extended 只控制你的内容是否用于 Gemini 的训练与作答依据;Googlebot 的正常索引和排名不受影响。
- AI 爬虫遵守 robots.txt 吗?
- 主要的具名爬虫(GPTBot、ClaudeBot、PerplexityBot、Google-Extended、CCBot)都公开承诺遵守 robots.txt。匿名抓取程序未必如此:robots.txt 是政策信号,不是强制机制。