🌐 中文
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebAI 智能体就绪度目录

AI 爬虫详解:robots.txt 该写什么

如今,几个具名爬虫决定着你的网站是否存在于 AI 答案之中。它们各有用途(训练、实时搜索或智能体浏览),并且都可以在 robots.txt 中单独放行或拒绝。这里是一份实用地图。

值得关注的爬虫

User-agent运营方供给什么
GPTBotOpenAI模型训练与 ChatGPT 浏览语料
OAI-SearchBotOpenAIChatGPT 搜索结果(实时引用)
ClaudeBotAnthropicClaude 的训练与检索
Claude-UserAnthropic代表 Claude 用户/智能体发起的抓取
PerplexityBotPerplexityPerplexity 答案引擎索引(被引用来源)
Google-ExtendedGoogleGemini 的训练与作答依据,与 Googlebot 排名相互独立
CCBotCommon Crawl众多研究/AI 项目使用的开放网络语料
Bytespider字节跳动模型训练
Baiduspider百度百度搜索索引(通往中文搜索的主要门户)
PetalBot华为Petal Search 索引与 AI 功能

有意识地决定,而不是默认放任

三套完整的策略,请有意识地选择一套:

1. 开放(让 AI 界面能找到你)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. 允许搜索,拒绝训练

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. 封闭

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
无论你选哪一套:请在 robots.txt 中保留 Sitemap: 行,并记住空的或缺失的 robots.txt 对合规爬虫来说意味着「全部允许」,这本身就是一个因不作为而作出的决定。

这如何影响你的审计

我们的 30 项检查审计会读取你的 robots.txt,并报告 AI 爬虫是否有明确规则。无论你选择哪个方向,沉默的得分都低于明确的策略,因为智能体及其运营方都会奖励清晰。

立即检查你的 robots.txt 和完整就绪度

常见问题

我应该屏蔽 GPTBot 吗?
这是商业决策,不是默认的技术选项。屏蔽会让你的内容从 ChatGPT 时代的答案和未来的训练中消失;放行则以内容换取在 AI 界面中的曝光。对多数希望被找到、被引用的企业来说,放行搜索/智能体类爬虫是务实的选择。
屏蔽 Google-Extended 会影响我的 Google 排名吗?
不会。Google-Extended 只控制你的内容是否用于 Gemini 的训练与作答依据;Googlebot 的正常索引和排名不受影响。
AI 爬虫遵守 robots.txt 吗?
主要的具名爬虫(GPTBot、ClaudeBot、PerplexityBot、Google-Extended、CCBot)都公开承诺遵守 robots.txt。匿名抓取程序未必如此:robots.txt 是政策信号,不是强制机制。
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย