🌐 Deutsch
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebVerzeichnis für KI-Agenten-Bereitschaft

KI-Crawler erklärt: was in die robots.txt gehört

Eine Handvoll benannter Crawler entscheidet inzwischen, ob Ihre Website in KI-Antworten existiert. Jeder dient einem anderen Zweck (Training, Live-Suche oder Agenten-Browsing), und jeder lässt sich in der robots.txt unabhängig erlauben oder ablehnen. Hier ist die praktische Landkarte.

Die Crawler, die zählen

User-agentBetreiberWas er speist
GPTBotOpenAIModelltraining und ChatGPT-Browsing-Korpus
OAI-SearchBotOpenAIChatGPT-Suchergebnisse (Live-Zitate)
ClaudeBotAnthropicClaude-Training und -Retrieval
Claude-UserAnthropicAbrufe im Auftrag eines Claude-Nutzers/-Agenten
PerplexityBotPerplexityIndex der Perplexity-Antwortmaschine (zitierte Quellen)
Google-ExtendedGoogleGemini-Training/-Grounding, getrennt vom Googlebot-Ranking
CCBotCommon CrawlOffenes Web-Korpus, genutzt von vielen Forschungs- und KI-Projekten
BytespiderByteDanceModelltraining
BaiduspiderBaiduBaidu-Suchindex (das Haupttor zur chinesischen Suche)
PetalBotHuaweiIndex von Petal Search und KI-Funktionen

Entscheiden Sie bewusst, nicht per Voreinstellung

Drei stimmige Richtlinien, wählen Sie eine bewusst:

1. Offen (in KI-Oberflächen auffindbar sein)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Suche ja, Training nein

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Geschlossen

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Was immer Sie wählen: Behalten Sie eine Sitemap:-Zeile in der robots.txt, und bedenken Sie, dass eine leere oder fehlende robots.txt für regelkonforme Crawler „alles erlaubt“ bedeutet, eine Entscheidung durch Unterlassen.

Wie sich das auf Ihr Audit auswirkt

Unser Audit mit 30 Prüfungen liest Ihre robots.txt und meldet, ob KI-Crawler explizite Regeln haben. Schweigen wird niedriger bewertet als eine bewusste Richtlinie, egal in welche Richtung, denn Agenten und ihre Betreiber belohnen Klarheit.

Prüfen Sie jetzt Ihre robots.txt und die vollständige Bereitschaft

Häufige Fragen

Sollte ich GPTBot blockieren?
Das ist eine Geschäftsentscheidung, kein technischer Standard. Blockieren entfernt Ihre Inhalte aus den Antworten der ChatGPT-Ära und aus künftigem Training; Erlauben tauscht Inhalte gegen Sichtbarkeit in KI-Oberflächen. Für die meisten Unternehmen, die gefunden und zitiert werden wollen, ist das Zulassen von Such- und Agenten-Crawlern die pragmatische Wahl.
Schadet das Blockieren von Google-Extended meinen Google-Rankings?
Nein. Google-Extended steuert nur die Nutzung Ihrer Inhalte für Gemini-Training und -Grounding; die normale Googlebot-Indexierung und das Ranking bleiben unberührt.
Respektieren KI-Crawler die robots.txt?
Die großen benannten Crawler (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) verpflichten sich öffentlich, die robots.txt zu respektieren. Unbenannte Scraper tun das möglicherweise nicht; die robots.txt ist ein Richtliniensignal, kein Durchsetzungsmechanismus.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย