Rastreadores de IA explicados - e o que colocar no robots.txt
Um punhado de rastreadores nomeados decide hoje se o seu site existe nas respostas de IA. Cada um serve a um propósito diferente - treinamento, busca ao vivo ou navegação por agentes - e cada um pode ser permitido ou recusado de forma independente no robots.txt. Aqui está o mapa prático.
Os rastreadores que importam
| User-agent | Operador | O que alimenta |
|---|---|---|
GPTBot | OpenAI | Treinamento de modelos e corpus de navegação do ChatGPT |
OAI-SearchBot | OpenAI | Resultados de busca do ChatGPT (citações ao vivo) |
ClaudeBot | Anthropic | Treinamento e recuperação do Claude |
Claude-User | Anthropic | Requisições feitas em nome de um usuário/agente do Claude |
PerplexityBot | Perplexity | Índice do mecanismo de respostas Perplexity (fontes citadas) |
Google-Extended | Treinamento/grounding do Gemini - separado do ranking do Googlebot | |
CCBot | Common Crawl | Corpus aberto da web usado por muitos projetos de pesquisa/IA |
Bytespider | ByteDance | Treinamento de modelos |
Baiduspider | Baidu | Índice de busca do Baidu (a porta principal da busca chinesa) |
PetalBot | Huawei | Índice do Petal Search e recursos de IA |
Decida deliberadamente, não por omissão
Três políticas coerentes - escolha uma de propósito:
1. Aberta (ser encontrável nas superfícies de IA)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Busca sim, treinamento não
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Fechada
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Seja qual for a escolha: mantenha uma linha
Sitemap: no robots.txt e lembre que um robots.txt vazio ou ausente significa "tudo permitido" para rastreadores que seguem as regras - uma decisão por omissão.Como isso afeta sua auditoria
Nossa auditoria de 30 verificações lê o seu robots.txt e informa se os rastreadores de IA têm regras explícitas - o silêncio pontua menos do que uma política deliberada, seja qual for a direção escolhida, porque agentes e seus operadores recompensam a clareza.
Verifique seu robots.txt e sua prontidão completa agora
Perguntas frequentes
- Devo bloquear o GPTBot?
- É uma decisão de negócio, não um padrão técnico. Bloquear remove seu conteúdo das respostas da era do ChatGPT e do treinamento futuro; permitir troca conteúdo por visibilidade nas superfícies de IA. Para a maioria das empresas que querem ser encontradas e citadas, permitir os rastreadores de busca/agentes é a escolha pragmática.
- Bloquear o Google-Extended prejudica meu ranking no Google?
- Não. O Google-Extended controla apenas o uso do seu conteúdo para treinamento e grounding do Gemini; a indexação e a classificação normais do Googlebot não são afetadas.
- Rastreadores de IA respeitam o robots.txt?
- Os principais rastreadores nomeados (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) se comprometem publicamente a respeitar o robots.txt. Raspadores sem nome podem não respeitar - o robots.txt é um sinal de política, não um mecanismo de aplicação.