ШІ-краулери: хто вони і що писати в robots.txt
Жменька іменованих краулерів тепер вирішує, чи існує ваш сайт у відповідях ШІ. Кожен служить своїй меті (навчання, живий пошук або агентний браузинг), і кожного можна незалежно дозволити чи заборонити в robots.txt. Ось практична мапа.
Краулери, які мають значення
| User-agent | Оператор | Що він наповнює |
|---|---|---|
GPTBot | OpenAI | Навчання моделей і корпус браузингу ChatGPT |
OAI-SearchBot | OpenAI | Результати пошуку ChatGPT (живі цитати) |
ClaudeBot | Anthropic | Навчання Claude та отримання даних для відповідей |
Claude-User | Anthropic | Запити, виконувані від імені користувача або агента Claude |
PerplexityBot | Perplexity | Індекс рушія відповідей Perplexity (цитовані джерела) |
Google-Extended | Навчання та граундинг Gemini (окремо від ранжування Googlebot) | |
CCBot | Common Crawl | Відкритий корпус вебу, який використовують багато дослідницьких і ШІ-проєктів |
Bytespider | ByteDance | Навчання моделей |
Baiduspider | Baidu | Пошуковий індекс Baidu (головні двері до китайського пошуку) |
PetalBot | Huawei | Індекс Petal Search і ШІ-функції |
Вирішуйте свідомо, а не за замовчуванням
Три цілісні політики; оберіть одну навмисно:
1. Відкрита (щоб вас знаходили в ШІ-інтерфейсах)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Пошуку так, навчанню ні
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Закрита
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Хоч би що ви обрали: залиште рядок
Sitemap: у robots.txt і пам’ятайте, що порожній або відсутній robots.txt означає «дозволено все» для краулерів, які дотримуються правил; це теж рішення, просто ухвалене за замовчуванням.Як це впливає на ваш аудит
Наш аудит із 30 перевірок читає ваш robots.txt і повідомляє, чи мають ШІ-краулери явні правила: мовчання оцінюється нижче, ніж свідома політика, хоч би який напрям ви обрали, бо агенти та їхні оператори винагороджують ясність.
Перевірте свій robots.txt і повну готовність зараз
Часті запитання
- Чи варто блокувати GPTBot?
- Це бізнес-рішення, а не технічне налаштування за замовчуванням. Блокування прибирає ваш контент із відповідей епохи ChatGPT і з майбутнього навчання; дозвіл обмінює контент на видимість у ШІ-інтерфейсах. Для більшості компаній, які хочуть, щоб їх знаходили й цитували, прагматичний вибір - дозволити краулери пошуку та агентів.
- Чи шкодить блокування Google-Extended моїм позиціям у Google?
- Ні. Google-Extended керує лише використанням вашого контенту для навчання та граундингу Gemini; звичайні індексація та ранжування Googlebot не зачіпаються.
- Чи дотримуються ШІ-краулери robots.txt?
- Великі іменовані краулери (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) публічно зобов’язуються дотримуватися robots.txt. Безіменні скрейпери можуть цього не робити: robots.txt - це сигнал політики, а не механізм примусу.