ИИ-краулеры: кто они и что писать в robots.txt
Горстка именованных краулеров теперь решает, существует ли ваш сайт в ответах ИИ. Каждый служит своей цели (обучение, живой поиск или агентский браузинг), и каждый можно независимо разрешить или запретить в robots.txt. Вот практическая карта.
Краулеры, которые имеют значение
| User-agent | Оператор | Что он наполняет |
|---|---|---|
GPTBot | OpenAI | Обучение моделей и корпус браузинга ChatGPT |
OAI-SearchBot | OpenAI | Результаты поиска ChatGPT (живые цитаты) |
ClaudeBot | Anthropic | Обучение Claude и извлечение данных для ответов |
Claude-User | Anthropic | Запросы, выполняемые от имени пользователя или агента Claude |
PerplexityBot | Perplexity | Индекс движка ответов Perplexity (цитируемые источники) |
Google-Extended | Обучение и граундинг Gemini (отдельно от ранжирования Googlebot) | |
CCBot | Common Crawl | Открытый корпус веба, используемый многими исследовательскими и ИИ-проектами |
Bytespider | ByteDance | Обучение моделей |
Baiduspider | Baidu | Поисковый индекс Baidu (главные ворота в китайский поиск) |
PetalBot | Huawei | Индекс Petal Search и ИИ-функции |
Решайте намеренно, а не по умолчанию
Три цельные политики; выберите одну осознанно:
1. Открытая (чтобы вас находили в ИИ-интерфейсах)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Поиску да, обучению нет
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Закрытая
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Что бы вы ни выбрали: сохраните строку
Sitemap: в robots.txt и помните, что пустой или отсутствующий robots.txt означает «разрешено всё» для соблюдающих правила краулеров; это тоже решение, просто принятое по умолчанию.Как это влияет на ваш аудит
Наш аудит из 30 проверок читает ваш robots.txt и сообщает, есть ли у ИИ-краулеров явные правила: молчание оценивается ниже, чем осознанная политика, в какую бы сторону вы ни решили, потому что агенты и их операторы вознаграждают ясность.
Проверьте свой robots.txt и полную готовность прямо сейчас
Частые вопросы
- Стоит ли блокировать GPTBot?
- Это бизнес-решение, а не техническая настройка по умолчанию. Блокировка убирает ваш контент из ответов эпохи ChatGPT и будущего обучения; разрешение обменивает контент на видимость в ИИ-интерфейсах. Для большинства компаний, которые хотят, чтобы их находили и цитировали, прагматичный выбор такой: разрешить краулеры поиска и агентов.
- Вредит ли блокировка Google-Extended моим позициям в Google?
- Нет. Google-Extended управляет только тем, как ваш контент используется для обучения и граундинга Gemini; обычные индексация и ранжирование Googlebot не затрагиваются.
- Соблюдают ли ИИ-краулеры robots.txt?
- Крупные именованные краулеры (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) публично обязуются соблюдать robots.txt. Анонимные скрейперы могут его игнорировать: robots.txt остаётся сигналом политики, а не механизмом принуждения.