AI-crawlers uitgelegd: wat zet u in robots.txt
Een handvol crawlers met een naam bepaalt inmiddels of uw site bestaat in AI-antwoorden. Elk dient een ander doel (training, live zoeken of agent-browsing) en elk kan in robots.txt afzonderlijk worden toegestaan of geweigerd. Dit is de praktische kaart.
De crawlers die ertoe doen
| User-agent | Beheerder | Wat hij voedt |
|---|---|---|
GPTBot | OpenAI | Modeltraining en het browsingcorpus van ChatGPT |
OAI-SearchBot | OpenAI | ChatGPT-zoekresultaten (live bronvermeldingen) |
ClaudeBot | Anthropic | Claude-training en -retrieval |
Claude-User | Anthropic | Opvragingen namens een Claude-gebruiker/-agent |
PerplexityBot | Perplexity | Index van de Perplexity-antwoordmachine (geciteerde bronnen) |
Google-Extended | Gemini-training/-grounding, losstaand van de Googlebot-ranking | |
CCBot | Common Crawl | Open webcorpus, gebruikt door veel onderzoeks- en AI-projecten |
Bytespider | ByteDance | Modeltraining |
Baiduspider | Baidu | Baidu-zoekindex (de belangrijkste toegang tot de Chinese zoekmarkt) |
PetalBot | Huawei | Petal Search-index en AI-functies |
Beslis bewust, niet standaard
Drie samenhangende beleidsopties, kies er bewust één:
1. Open (vindbaar zijn in AI-omgevingen)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Zoeken ja, training nee
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Gesloten
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Wat u ook kiest: houd een
Sitemap:-regel in robots.txt, en bedenk dat een lege of ontbrekende robots.txt voor regelvolgende crawlers "alles toegestaan" betekent, een beslissing door nalaten.Zo beïnvloedt dit uw audit
Onze audit met 30 controles leest uw robots.txt en rapporteert of AI-crawlers expliciete regels hebben. Stilte scoort lager dan een bewust beleid, welke richting u ook kiest, want agenten en hun beheerders belonen duidelijkheid.
Controleer nu uw robots.txt en uw volledige gereedheid
Veelgestelde vragen
- Moet ik GPTBot blokkeren?
- Dat is een zakelijke beslissing, geen technische standaardkeuze. Blokkeren haalt uw content uit de antwoorden van het ChatGPT-tijdperk en uit toekomstige training; toestaan ruilt content voor zichtbaarheid in AI-omgevingen. Voor de meeste bedrijven die gevonden en geciteerd willen worden, is het toelaten van zoek- en agentcrawlers de pragmatische keuze.
- Schaadt het blokkeren van Google-Extended mijn Google-rankings?
- Nee. Google-Extended regelt alleen het gebruik van uw content voor Gemini-training en -grounding; de normale indexering en ranking door Googlebot blijven onaangetast.
- Respecteren AI-crawlers robots.txt?
- De grote crawlers met een naam (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) beloven publiekelijk robots.txt te respecteren. Naamloze scrapers doen dat mogelijk niet; robots.txt is een beleidssignaal, geen handhavingsmechanisme.