Roboty indeksujące AI: kim są i co wpisać w robots.txt
Garstka nazwanych robotów indeksujących (crawlerów) decyduje dziś, czy Twoja witryna istnieje w odpowiedziach AI. Każdy służy innemu celowi (trening, wyszukiwanie na żywo lub przeglądanie przez agentów) i każdemu można niezależnie zezwolić lub odmówić w robots.txt. Oto praktyczna mapa.
Roboty, które mają znaczenie
| User-agent | Operator | Co zasila |
|---|---|---|
GPTBot | OpenAI | Trening modeli i korpus przeglądania ChatGPT |
OAI-SearchBot | OpenAI | Wyniki wyszukiwania ChatGPT (cytowania na żywo) |
ClaudeBot | Anthropic | Trening Claude i pozyskiwanie treści do odpowiedzi |
Claude-User | Anthropic | Pobrania wykonywane w imieniu użytkownika lub agenta Claude |
PerplexityBot | Perplexity | Indeks silnika odpowiedzi Perplexity (cytowane źródła) |
Google-Extended | Trening i grounding Gemini (osobno od rankingu Googlebota) | |
CCBot | Common Crawl | Otwarty korpus sieci używany przez wiele projektów badawczych i AI |
Bytespider | ByteDance | Trening modeli |
Baiduspider | Baidu | Indeks wyszukiwarki Baidu (główna brama do chińskiego wyszukiwania) |
PetalBot | Huawei | Indeks Petal Search i funkcje AI |
Decyduj świadomie, nie domyślnie
Trzy spójne polityki; wybierz jedną celowo:
1. Otwarta (widoczność w interfejsach AI)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Wyszukiwanie tak, trening nie
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Zamknięta
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Cokolwiek wybierzesz: zachowaj wiersz
Sitemap: w robots.txt i pamiętaj, że pusty lub brakujący robots.txt oznacza dla przestrzegających reguł robotów „wszystko dozwolone”; to też decyzja, tyle że podjęta przez zaniechanie.Jak to wpływa na Twój audyt
Nasz audyt złożony z 30 kontroli czyta Twój robots.txt i raportuje, czy roboty AI mają jawne reguły: milczenie punktuje niżej niż świadoma polityka, niezależnie od wybranego kierunku, ponieważ agenci i ich operatorzy nagradzają jasność.
Sprawdź swój robots.txt i pełną gotowość teraz
Częste pytania
- Czy blokować GPTBot?
- To decyzja biznesowa, a nie techniczne ustawienie domyślne. Blokada usuwa Twoje treści z odpowiedzi ery ChatGPT i z przyszłego treningu; zezwolenie wymienia treść na widoczność w interfejsach AI. Dla większości firm, które chcą być znajdowane i cytowane, pragmatycznym wyborem jest zezwolenie robotom wyszukiwania i agentów.
- Czy blokada Google-Extended szkodzi moim pozycjom w Google?
- Nie. Google-Extended steruje wyłącznie wykorzystaniem Twoich treści do treningu i groundingu Gemini; zwykłe indeksowanie i ranking Googlebota pozostają nietknięte.
- Czy roboty AI respektują robots.txt?
- Najważniejsze nazwane roboty (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) publicznie zobowiązują się do respektowania robots.txt. Anonimowe scrapery mogą tego nie robić: robots.txt to sygnał polityki, a nie mechanizm egzekwowania.