🌐 Italiano
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebDirectory della preparazione per gli agenti IA

I crawler IA spiegati, e cosa mettere nel robots.txt

Una manciata di crawler dichiarati decide ormai se il tuo sito esiste nelle risposte dell'IA. Ognuno serve uno scopo diverso (addestramento, ricerca in tempo reale o navigazione degli agenti) e ognuno può essere permesso o rifiutato in modo indipendente nel robots.txt. Ecco la mappa pratica.

I crawler che contano

User-agentOperatoreCosa alimenta
GPTBotOpenAIAddestramento dei modelli e corpus di navigazione di ChatGPT
OAI-SearchBotOpenAIRisultati di ricerca di ChatGPT (citazioni in tempo reale)
ClaudeBotAnthropicAddestramento e recupero di informazioni per Claude
Claude-UserAnthropicRichieste effettuate per conto di un utente o agente Claude
PerplexityBotPerplexityIndice del motore di risposte di Perplexity (fonti citate)
Google-ExtendedGoogleAddestramento e grounding di Gemini, separato dal posizionamento di Googlebot
CCBotCommon CrawlCorpus aperto del web usato da molti progetti di ricerca e IA
BytespiderByteDanceAddestramento dei modelli
BaiduspiderBaiduIndice di ricerca di Baidu (la porta principale della ricerca cinese)
PetalBotHuaweiIndice di Petal Search e funzioni IA

Decidi deliberatamente, non per default

Tre policy coerenti; scegline una di proposito:

1. Aperta (farsi trovare nelle superfici IA)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Ricerca sì, addestramento no

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Chiusa

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Qualunque cosa tu scelga: mantieni una riga Sitemap: nel robots.txt, e ricorda che un robots.txt vuoto o assente significa "tutto permesso" per i crawler che lo rispettano: una decisione per omissione.

Come questo incide sul tuo audit

Il nostro audit con 30 controlli legge il tuo robots.txt e riferisce se i crawler IA hanno regole esplicite: il silenzio ottiene un punteggio più basso di una policy deliberata, in qualunque direzione tu scelga, perché gli agenti e i loro operatori premiano la chiarezza.

Verifica subito il tuo robots.txt e la tua preparazione completa

Domande frequenti

Dovrei bloccare GPTBot?
È una decisione di business, non un default tecnico. Bloccarlo rimuove i tuoi contenuti dalle risposte dell'era ChatGPT e dall'addestramento futuro; permetterlo scambia contenuti per visibilità nelle superfici IA. Per la maggior parte delle attività che vogliono essere trovate e citate, permettere i crawler di ricerca e degli agenti è la scelta pragmatica.
Bloccare Google-Extended danneggia il mio posizionamento su Google?
No. Google-Extended controlla solo l'uso dei tuoi contenuti per l'addestramento e il grounding di Gemini; l'indicizzazione e il posizionamento normali di Googlebot non ne risentono.
I crawler IA rispettano robots.txt?
I principali crawler dichiarati (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) si impegnano pubblicamente a rispettare robots.txt. Gli scraper anonimi possono non farlo: robots.txt è un segnale di policy, non uno strumento per farla rispettare.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย