🌐 Português
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebDiretório de Prontidão para Agentes de IA

Rastreadores de IA explicados - e o que colocar no robots.txt

Um punhado de rastreadores nomeados decide hoje se o seu site existe nas respostas de IA. Cada um serve a um propósito diferente - treinamento, busca ao vivo ou navegação por agentes - e cada um pode ser permitido ou recusado de forma independente no robots.txt. Aqui está o mapa prático.

Os rastreadores que importam

User-agentOperadorO que alimenta
GPTBotOpenAITreinamento de modelos e corpus de navegação do ChatGPT
OAI-SearchBotOpenAIResultados de busca do ChatGPT (citações ao vivo)
ClaudeBotAnthropicTreinamento e recuperação do Claude
Claude-UserAnthropicRequisições feitas em nome de um usuário/agente do Claude
PerplexityBotPerplexityÍndice do mecanismo de respostas Perplexity (fontes citadas)
Google-ExtendedGoogleTreinamento/grounding do Gemini - separado do ranking do Googlebot
CCBotCommon CrawlCorpus aberto da web usado por muitos projetos de pesquisa/IA
BytespiderByteDanceTreinamento de modelos
BaiduspiderBaiduÍndice de busca do Baidu (a porta principal da busca chinesa)
PetalBotHuaweiÍndice do Petal Search e recursos de IA

Decida deliberadamente, não por omissão

Três políticas coerentes - escolha uma de propósito:

1. Aberta (ser encontrável nas superfícies de IA)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Busca sim, treinamento não

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Fechada

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Seja qual for a escolha: mantenha uma linha Sitemap: no robots.txt e lembre que um robots.txt vazio ou ausente significa "tudo permitido" para rastreadores que seguem as regras - uma decisão por omissão.

Como isso afeta sua auditoria

Nossa auditoria de 30 verificações lê o seu robots.txt e informa se os rastreadores de IA têm regras explícitas - o silêncio pontua menos do que uma política deliberada, seja qual for a direção escolhida, porque agentes e seus operadores recompensam a clareza.

Verifique seu robots.txt e sua prontidão completa agora

Perguntas frequentes

Devo bloquear o GPTBot?
É uma decisão de negócio, não um padrão técnico. Bloquear remove seu conteúdo das respostas da era do ChatGPT e do treinamento futuro; permitir troca conteúdo por visibilidade nas superfícies de IA. Para a maioria das empresas que querem ser encontradas e citadas, permitir os rastreadores de busca/agentes é a escolha pragmática.
Bloquear o Google-Extended prejudica meu ranking no Google?
Não. O Google-Extended controla apenas o uso do seu conteúdo para treinamento e grounding do Gemini; a indexação e a classificação normais do Googlebot não são afetadas.
Rastreadores de IA respeitam o robots.txt?
Os principais rastreadores nomeados (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) se comprometem publicamente a respeitar o robots.txt. Raspadores sem nome podem não respeitar - o robots.txt é um sinal de política, não um mecanismo de aplicação.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย