🌐 Español
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebDirectorio de preparación para agentes de IA

Rastreadores de IA explicados, y qué poner en robots.txt

Un puñado de rastreadores identificados decide hoy si su sitio existe en las respuestas de IA. Cada uno sirve a un propósito distinto (entrenamiento, búsqueda en vivo o navegación de agentes) y cada uno puede permitirse o rechazarse de forma independiente en robots.txt. Este es el mapa práctico.

Los rastreadores que importan

User-agentOperadorQué alimenta
GPTBotOpenAIEntrenamiento de modelos y corpus de navegación de ChatGPT
OAI-SearchBotOpenAIResultados de búsqueda de ChatGPT (citas en vivo)
ClaudeBotAnthropicEntrenamiento y recuperación de Claude
Claude-UserAnthropicDescargas realizadas en nombre de un usuario o agente de Claude
PerplexityBotPerplexityÍndice del motor de respuestas de Perplexity (fuentes citadas)
Google-ExtendedGoogleEntrenamiento y fundamentación de Gemini, independiente del posicionamiento de Googlebot
CCBotCommon CrawlCorpus abierto de la web usado por muchos proyectos de investigación e IA
BytespiderByteDanceEntrenamiento de modelos
BaiduspiderBaiduÍndice de búsqueda de Baidu (la puerta principal a la búsqueda china)
PetalBotHuaweiÍndice de Petal Search y funciones de IA

Decida deliberadamente, no por omisión

Tres políticas coherentes; elija una a propósito:

1. Abierta (ser localizable en las superficies de IA)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. Búsqueda sí, entrenamiento no

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. Cerrada

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Elija lo que elija: mantenga una línea Sitemap: en robots.txt, y recuerde que un robots.txt vacío o ausente significa "todo permitido" para los rastreadores que lo cumplen: una decisión por omisión.

Cómo afecta esto a su auditoría

Nuestra auditoría de 30 comprobaciones lee su robots.txt e informa si los rastreadores de IA tienen reglas explícitas: el silencio puntúa más bajo que una política deliberada, sea cual sea la dirección que elija, porque los agentes y sus operadores premian la claridad.

Compruebe su robots.txt y su preparación completa ahora

Preguntas frecuentes

¿Debería bloquear GPTBot?
Es una decisión de negocio, no un valor técnico por defecto. Bloquearlo elimina su contenido de las respuestas de la era ChatGPT y del entrenamiento futuro; permitirlo intercambia contenido por visibilidad en las superficies de IA. Para la mayoría de los negocios que quieren ser encontrados y citados, permitir los rastreadores de búsqueda y de agentes es la opción pragmática.
¿Bloquear Google-Extended perjudica mi posicionamiento en Google?
No. Google-Extended solo controla el uso de su contenido para el entrenamiento y la fundamentación de Gemini; la indexación y el posicionamiento normales de Googlebot no se ven afectados.
¿Los rastreadores de IA respetan robots.txt?
Los principales rastreadores identificados (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) se comprometen públicamente a respetar robots.txt. Los scrapers anónimos pueden no hacerlo: robots.txt es una señal de política, no un mecanismo de aplicación.
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย