I crawler IA spiegati, e cosa mettere nel robots.txt
Una manciata di crawler dichiarati decide ormai se il tuo sito esiste nelle risposte dell'IA. Ognuno serve uno scopo diverso (addestramento, ricerca in tempo reale o navigazione degli agenti) e ognuno può essere permesso o rifiutato in modo indipendente nel robots.txt. Ecco la mappa pratica.
I crawler che contano
| User-agent | Operatore | Cosa alimenta |
|---|---|---|
GPTBot | OpenAI | Addestramento dei modelli e corpus di navigazione di ChatGPT |
OAI-SearchBot | OpenAI | Risultati di ricerca di ChatGPT (citazioni in tempo reale) |
ClaudeBot | Anthropic | Addestramento e recupero di informazioni per Claude |
Claude-User | Anthropic | Richieste effettuate per conto di un utente o agente Claude |
PerplexityBot | Perplexity | Indice del motore di risposte di Perplexity (fonti citate) |
Google-Extended | Addestramento e grounding di Gemini, separato dal posizionamento di Googlebot | |
CCBot | Common Crawl | Corpus aperto del web usato da molti progetti di ricerca e IA |
Bytespider | ByteDance | Addestramento dei modelli |
Baiduspider | Baidu | Indice di ricerca di Baidu (la porta principale della ricerca cinese) |
PetalBot | Huawei | Indice di Petal Search e funzioni IA |
Decidi deliberatamente, non per default
Tre policy coerenti; scegline una di proposito:
1. Aperta (farsi trovare nelle superfici IA)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Ricerca sì, addestramento no
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Chiusa
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Qualunque cosa tu scelga: mantieni una riga
Sitemap: nel robots.txt, e ricorda che un robots.txt vuoto o assente significa "tutto permesso" per i crawler che lo rispettano: una decisione per omissione.Come questo incide sul tuo audit
Il nostro audit con 30 controlli legge il tuo robots.txt e riferisce se i crawler IA hanno regole esplicite: il silenzio ottiene un punteggio più basso di una policy deliberata, in qualunque direzione tu scelga, perché gli agenti e i loro operatori premiano la chiarezza.
Verifica subito il tuo robots.txt e la tua preparazione completa
Domande frequenti
- Dovrei bloccare GPTBot?
- È una decisione di business, non un default tecnico. Bloccarlo rimuove i tuoi contenuti dalle risposte dell'era ChatGPT e dall'addestramento futuro; permetterlo scambia contenuti per visibilità nelle superfici IA. Per la maggior parte delle attività che vogliono essere trovate e citate, permettere i crawler di ricerca e degli agenti è la scelta pragmatica.
- Bloccare Google-Extended danneggia il mio posizionamento su Google?
- No. Google-Extended controlla solo l'uso dei tuoi contenuti per l'addestramento e il grounding di Gemini; l'indicizzazione e il posizionamento normali di Googlebot non ne risentono.
- I crawler IA rispettano robots.txt?
- I principali crawler dichiarati (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) si impegnano pubblicamente a rispettare robots.txt. Gli scraper anonimi possono non farlo: robots.txt è un segnale di policy, non uno strumento per farla rispettare.