AI crawlery srozumitelně: co patří do robots.txt
Hrstka jmenovaných crawlerů dnes rozhoduje, zda váš web existuje v odpovědích AI. Každý slouží jinému účelu (trénink, živé vyhledávání, nebo agentní prohlížení) a každý lze v robots.txt nezávisle povolit či odmítnout. Tady je praktická mapa.
Crawlery, na kterých záleží
| User-agent | Provozovatel | Co naplňuje |
|---|---|---|
GPTBot | OpenAI | Trénink modelů a korpus prohlížení ChatGPT |
OAI-SearchBot | OpenAI | Výsledky vyhledávání ChatGPT (živé citace) |
ClaudeBot | Anthropic | Trénink Claude a vyhledávání podkladů |
Claude-User | Anthropic | Požadavky prováděné jménem uživatele nebo agenta Claude |
PerplexityBot | Perplexity | Index odpovědního enginu Perplexity (citované zdroje) |
Google-Extended | Trénink a grounding Gemini (odděleno od řazení Googlebotem) | |
CCBot | Common Crawl | Otevřený webový korpus využívaný mnoha výzkumnými a AI projekty |
Bytespider | ByteDance | Trénink modelů |
Baiduspider | Baidu | Vyhledávací index Baidu (hlavní brána do čínského vyhledávání) |
PetalBot | Huawei | Index Petal Search a AI funkce |
Rozhodněte se záměrně, ne výchozím stavem
Tři ucelené politiky; vyberte si jednu vědomě:
1. Otevřená (buďte k nalezení v AI rozhraních)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Vyhledávání ano, trénink ne
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Uzavřená
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Ať zvolíte cokoli: ponechte v robots.txt řádek
Sitemap: a pamatujte, že prázdný nebo chybějící robots.txt znamená pro poslušné crawlery „vše povoleno“; i to je rozhodnutí, jen učiněné mlčky.Jak to ovlivní váš audit
Náš audit s 30 kontrolami čte váš robots.txt a hlásí, zda mají AI crawlery explicitní pravidla: mlčení se hodnotí hůř než záměrná politika, ať už zvolíte kterýkoli směr, protože agenti a jejich provozovatelé odměňují srozumitelnost.
Zkontrolujte svůj robots.txt a celou připravenost hned
Časté dotazy
- Mám blokovat GPTBot?
- Je to obchodní rozhodnutí, ne technická výchozí volba. Blokování odstraní váš obsah z odpovědí éry ChatGPT i z budoucího tréninku; povolení vyměňuje obsah za viditelnost v AI rozhraních. Pro většinu firem, které chtějí být k nalezení a citovány, je pragmatickou volbou povolit crawlery vyhledávání a agentů.
- Poškodí blokování Google-Extended mé pozice v Google?
- Ne. Google-Extended řídí pouze využití vašeho obsahu pro trénink a grounding Gemini; běžné indexování a řazení Googlebotem zůstává nedotčeno.
- Respektují AI crawlery robots.txt?
- Velké jmenované crawlery (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) se veřejně zavazují robots.txt respektovat. Bezejmenné scrapery nemusí: robots.txt je signál politiky, ne vynucovací mechanismus.