Rastreadores de IA explicados, y qué poner en robots.txt
Un puñado de rastreadores identificados decide hoy si su sitio existe en las respuestas de IA. Cada uno sirve a un propósito distinto (entrenamiento, búsqueda en vivo o navegación de agentes) y cada uno puede permitirse o rechazarse de forma independiente en robots.txt. Este es el mapa práctico.
Los rastreadores que importan
| User-agent | Operador | Qué alimenta |
|---|---|---|
GPTBot | OpenAI | Entrenamiento de modelos y corpus de navegación de ChatGPT |
OAI-SearchBot | OpenAI | Resultados de búsqueda de ChatGPT (citas en vivo) |
ClaudeBot | Anthropic | Entrenamiento y recuperación de Claude |
Claude-User | Anthropic | Descargas realizadas en nombre de un usuario o agente de Claude |
PerplexityBot | Perplexity | Índice del motor de respuestas de Perplexity (fuentes citadas) |
Google-Extended | Entrenamiento y fundamentación de Gemini, independiente del posicionamiento de Googlebot | |
CCBot | Common Crawl | Corpus abierto de la web usado por muchos proyectos de investigación e IA |
Bytespider | ByteDance | Entrenamiento de modelos |
Baiduspider | Baidu | Índice de búsqueda de Baidu (la puerta principal a la búsqueda china) |
PetalBot | Huawei | Índice de Petal Search y funciones de IA |
Decida deliberadamente, no por omisión
Tres políticas coherentes; elija una a propósito:
1. Abierta (ser localizable en las superficies de IA)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. Búsqueda sí, entrenamiento no
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. Cerrada
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Elija lo que elija: mantenga una línea
Sitemap: en robots.txt, y recuerde que un robots.txt vacío o ausente significa "todo permitido" para los rastreadores que lo cumplen: una decisión por omisión.Cómo afecta esto a su auditoría
Nuestra auditoría de 30 comprobaciones lee su robots.txt e informa si los rastreadores de IA tienen reglas explícitas: el silencio puntúa más bajo que una política deliberada, sea cual sea la dirección que elija, porque los agentes y sus operadores premian la claridad.
Compruebe su robots.txt y su preparación completa ahora
Preguntas frecuentes
- ¿Debería bloquear GPTBot?
- Es una decisión de negocio, no un valor técnico por defecto. Bloquearlo elimina su contenido de las respuestas de la era ChatGPT y del entrenamiento futuro; permitirlo intercambia contenido por visibilidad en las superficies de IA. Para la mayoría de los negocios que quieren ser encontrados y citados, permitir los rastreadores de búsqueda y de agentes es la opción pragmática.
- ¿Bloquear Google-Extended perjudica mi posicionamiento en Google?
- No. Google-Extended solo controla el uso de su contenido para el entrenamiento y la fundamentación de Gemini; la indexación y el posicionamiento normales de Googlebot no se ven afectados.
- ¿Los rastreadores de IA respetan robots.txt?
- Los principales rastreadores identificados (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) se comprometen públicamente a respetar robots.txt. Los scrapers anónimos pueden no hacerlo: robots.txt es una señal de política, no un mecanismo de aplicación.