🌐 Русский
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebКаталог готовности сайтов к ИИ-агентам

ИИ-краулеры: кто они и что писать в robots.txt

Горстка именованных краулеров теперь решает, существует ли ваш сайт в ответах ИИ. Каждый служит своей цели (обучение, живой поиск или агентский браузинг), и каждый можно независимо разрешить или запретить в robots.txt. Вот практическая карта.

Краулеры, которые имеют значение

User-agentОператорЧто он наполняет
GPTBotOpenAIОбучение моделей и корпус браузинга ChatGPT
OAI-SearchBotOpenAIРезультаты поиска ChatGPT (живые цитаты)
ClaudeBotAnthropicОбучение Claude и извлечение данных для ответов
Claude-UserAnthropicЗапросы, выполняемые от имени пользователя или агента Claude
PerplexityBotPerplexityИндекс движка ответов Perplexity (цитируемые источники)
Google-ExtendedGoogleОбучение и граундинг Gemini (отдельно от ранжирования Googlebot)
CCBotCommon CrawlОткрытый корпус веба, используемый многими исследовательскими и ИИ-проектами
BytespiderByteDanceОбучение моделей
BaiduspiderBaiduПоисковый индекс Baidu (главные ворота в китайский поиск)
PetalBotHuaweiИндекс Petal Search и ИИ-функции

Решайте намеренно, а не по умолчанию

Три цельные политики; выберите одну осознанно:

1. Открытая (чтобы вас находили в ИИ-интерфейсах)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Поиску да, обучению нет

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Закрытая

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Что бы вы ни выбрали: сохраните строку Sitemap: в robots.txt и помните, что пустой или отсутствующий robots.txt означает «разрешено всё» для соблюдающих правила краулеров; это тоже решение, просто принятое по умолчанию.

Как это влияет на ваш аудит

Наш аудит из 30 проверок читает ваш robots.txt и сообщает, есть ли у ИИ-краулеров явные правила: молчание оценивается ниже, чем осознанная политика, в какую бы сторону вы ни решили, потому что агенты и их операторы вознаграждают ясность.

Проверьте свой robots.txt и полную готовность прямо сейчас

Частые вопросы

Стоит ли блокировать GPTBot?
Это бизнес-решение, а не техническая настройка по умолчанию. Блокировка убирает ваш контент из ответов эпохи ChatGPT и будущего обучения; разрешение обменивает контент на видимость в ИИ-интерфейсах. Для большинства компаний, которые хотят, чтобы их находили и цитировали, прагматичный выбор такой: разрешить краулеры поиска и агентов.
Вредит ли блокировка Google-Extended моим позициям в Google?
Нет. Google-Extended управляет только тем, как ваш контент используется для обучения и граундинга Gemini; обычные индексация и ранжирование Googlebot не затрагиваются.
Соблюдают ли ИИ-краулеры robots.txt?
Крупные именованные краулеры (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) публично обязуются соблюдать robots.txt. Анонимные скрейперы могут его игнорировать: robots.txt остаётся сигналом политики, а не механизмом принуждения.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย