KI-Crawler erklärt: was in die robots.txt gehört
Eine Handvoll benannter Crawler entscheidet inzwischen, ob Ihre Website in KI-Antworten existiert. Jeder dient einem anderen Zweck (Training, Live-Suche oder Agenten-Browsing), und jeder lässt sich in der robots.txt unabhängig erlauben oder ablehnen. Hier ist die praktische Landkarte.
Die Crawler, die zählen
| User-agent | Betreiber | Was er speist |
|---|---|---|
GPTBot | OpenAI | Modelltraining und ChatGPT-Browsing-Korpus |
OAI-SearchBot | OpenAI | ChatGPT-Suchergebnisse (Live-Zitate) |
ClaudeBot | Anthropic | Claude-Training und -Retrieval |
Claude-User | Anthropic | Abrufe im Auftrag eines Claude-Nutzers/-Agenten |
PerplexityBot | Perplexity | Index der Perplexity-Antwortmaschine (zitierte Quellen) |
Google-Extended | Gemini-Training/-Grounding, getrennt vom Googlebot-Ranking | |
CCBot | Common Crawl | Offenes Web-Korpus, genutzt von vielen Forschungs- und KI-Projekten |
Bytespider | ByteDance | Modelltraining |
Baiduspider | Baidu | Baidu-Suchindex (das Haupttor zur chinesischen Suche) |
PetalBot | Huawei | Index von Petal Search und KI-Funktionen |
Entscheiden Sie bewusst, nicht per Voreinstellung
Drei stimmige Richtlinien, wählen Sie eine bewusst:
1. Offen (in KI-Oberflächen auffindbar sein)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Suche ja, Training nein
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Geschlossen
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Was immer Sie wählen: Behalten Sie eine
Sitemap:-Zeile in der robots.txt, und bedenken Sie, dass eine leere oder fehlende robots.txt für regelkonforme Crawler „alles erlaubt“ bedeutet, eine Entscheidung durch Unterlassen.Wie sich das auf Ihr Audit auswirkt
Unser Audit mit 30 Prüfungen liest Ihre robots.txt und meldet, ob KI-Crawler explizite Regeln haben. Schweigen wird niedriger bewertet als eine bewusste Richtlinie, egal in welche Richtung, denn Agenten und ihre Betreiber belohnen Klarheit.
Prüfen Sie jetzt Ihre robots.txt und die vollständige Bereitschaft
Häufige Fragen
- Sollte ich GPTBot blockieren?
- Das ist eine Geschäftsentscheidung, kein technischer Standard. Blockieren entfernt Ihre Inhalte aus den Antworten der ChatGPT-Ära und aus künftigem Training; Erlauben tauscht Inhalte gegen Sichtbarkeit in KI-Oberflächen. Für die meisten Unternehmen, die gefunden und zitiert werden wollen, ist das Zulassen von Such- und Agenten-Crawlern die pragmatische Wahl.
- Schadet das Blockieren von Google-Extended meinen Google-Rankings?
- Nein. Google-Extended steuert nur die Nutzung Ihrer Inhalte für Gemini-Training und -Grounding; die normale Googlebot-Indexierung und das Ranking bleiben unberührt.
- Respektieren KI-Crawler die robots.txt?
- Die großen benannten Crawler (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) verpflichten sich öffentlich, die robots.txt zu respektieren. Unbenannte Scraper tun das möglicherweise nicht; die robots.txt ist ein Richtliniensignal, kein Durchsetzungsmechanismus.