Les robots d'exploration IA expliqués, et quoi mettre dans robots.txt
Une poignée de robots d'exploration (crawlers) identifiés décident désormais si votre site existe dans les réponses IA. Chacun sert un objectif différent (entraînement, recherche en direct ou navigation d'agents) et chacun peut être autorisé ou refusé indépendamment dans robots.txt. Voici la carte pratique.
Les robots qui comptent
| User-agent | Opérateur | Ce qu'il alimente |
|---|---|---|
GPTBot | OpenAI | Entraînement des modèles et corpus de navigation de ChatGPT |
OAI-SearchBot | OpenAI | Résultats de recherche ChatGPT (citations en direct) |
ClaudeBot | Anthropic | Entraînement et récupération pour Claude |
Claude-User | Anthropic | Requêtes effectuées pour le compte d'un utilisateur ou agent Claude |
PerplexityBot | Perplexity | Index du moteur de réponses Perplexity (sources citées) |
Google-Extended | Entraînement et ancrage de Gemini, distinct du classement Googlebot | |
CCBot | Common Crawl | Corpus web ouvert utilisé par de nombreux projets de recherche et IA |
Bytespider | ByteDance | Entraînement des modèles |
Baiduspider | Baidu | Index de recherche Baidu (la porte d'entrée principale de la recherche chinoise) |
PetalBot | Huawei | Index Petal Search et fonctionnalités IA |
Décidez délibérément, pas par défaut
Trois politiques cohérentes; choisissez-en une à dessein:
1. Ouvert (être trouvable dans les surfaces IA)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Recherche oui, entraînement non
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Fermé
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Quel que soit votre choix: gardez une ligne
Sitemap: dans robots.txt, et rappelez-vous qu'un robots.txt vide ou absent signifie « tout est autorisé » pour les robots conformes: une décision par omission.Ce que cela change pour votre audit
Notre audit en 30 contrôles lit votre robots.txt et indique si les robots d'exploration IA disposent de règles explicites: le silence obtient un score plus bas qu'une politique délibérée, quelle que soit la direction choisie, car les agents et leurs opérateurs récompensent la clarté.
Vérifiez votre robots.txt et votre préparation complète maintenant
Questions fréquentes
- Dois-je bloquer GPTBot?
- C'est une décision commerciale, pas un réglage technique par défaut. Bloquer retire votre contenu des réponses de l'ère ChatGPT et de l'entraînement futur; autoriser échange du contenu contre de la visibilité dans les surfaces IA. Pour la plupart des entreprises qui veulent être trouvées et citées, autoriser les robots de recherche et d'agents est le choix pragmatique.
- Bloquer Google-Extended nuit-il à mon classement Google?
- Non. Google-Extended contrôle uniquement l'utilisation de votre contenu pour l'entraînement et l'ancrage de Gemini; l'indexation et le classement normaux par Googlebot ne sont pas affectés.
- Les robots d'exploration IA respectent-ils robots.txt?
- Les grands robots identifiés (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) s'engagent publiquement à respecter robots.txt. Les extracteurs anonymes ne le font pas forcément: robots.txt est un signal de politique, pas un mécanisme d'application.