🌐 Українська
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebКаталог готовності сайтів до ШІ-агентів

ШІ-краулери: хто вони і що писати в robots.txt

Жменька іменованих краулерів тепер вирішує, чи існує ваш сайт у відповідях ШІ. Кожен служить своїй меті (навчання, живий пошук або агентний браузинг), і кожного можна незалежно дозволити чи заборонити в robots.txt. Ось практична мапа.

Краулери, які мають значення

User-agentОператорЩо він наповнює
GPTBotOpenAIНавчання моделей і корпус браузингу ChatGPT
OAI-SearchBotOpenAIРезультати пошуку ChatGPT (живі цитати)
ClaudeBotAnthropicНавчання Claude та отримання даних для відповідей
Claude-UserAnthropicЗапити, виконувані від імені користувача або агента Claude
PerplexityBotPerplexityІндекс рушія відповідей Perplexity (цитовані джерела)
Google-ExtendedGoogleНавчання та граундинг Gemini (окремо від ранжування Googlebot)
CCBotCommon CrawlВідкритий корпус вебу, який використовують багато дослідницьких і ШІ-проєктів
BytespiderByteDanceНавчання моделей
BaiduspiderBaiduПошуковий індекс Baidu (головні двері до китайського пошуку)
PetalBotHuaweiІндекс Petal Search і ШІ-функції

Вирішуйте свідомо, а не за замовчуванням

Три цілісні політики; оберіть одну навмисно:

1. Відкрита (щоб вас знаходили в ШІ-інтерфейсах)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Пошуку так, навчанню ні

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Закрита

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Хоч би що ви обрали: залиште рядок Sitemap: у robots.txt і пам’ятайте, що порожній або відсутній robots.txt означає «дозволено все» для краулерів, які дотримуються правил; це теж рішення, просто ухвалене за замовчуванням.

Як це впливає на ваш аудит

Наш аудит із 30 перевірок читає ваш robots.txt і повідомляє, чи мають ШІ-краулери явні правила: мовчання оцінюється нижче, ніж свідома політика, хоч би який напрям ви обрали, бо агенти та їхні оператори винагороджують ясність.

Перевірте свій robots.txt і повну готовність зараз

Часті запитання

Чи варто блокувати GPTBot?
Це бізнес-рішення, а не технічне налаштування за замовчуванням. Блокування прибирає ваш контент із відповідей епохи ChatGPT і з майбутнього навчання; дозвіл обмінює контент на видимість у ШІ-інтерфейсах. Для більшості компаній, які хочуть, щоб їх знаходили й цитували, прагматичний вибір - дозволити краулери пошуку та агентів.
Чи шкодить блокування Google-Extended моїм позиціям у Google?
Ні. Google-Extended керує лише використанням вашого контенту для навчання та граундингу Gemini; звичайні індексація та ранжування Googlebot не зачіпаються.
Чи дотримуються ШІ-краулери robots.txt?
Великі іменовані краулери (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) публічно зобов’язуються дотримуватися robots.txt. Безіменні скрейпери можуть цього не робити: robots.txt - це сигнал політики, а не механізм примусу.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย