AI 크롤러 해설 - robots.txt에 무엇을 넣어야 하나
이제 이름이 알려진 소수의 크롤러가 AI 답변 속에 내 사이트가 존재할지를 결정합니다. 각 크롤러는 학습, 실시간 검색, 에이전트 브라우징이라는 서로 다른 목적을 가지며, robots.txt에서 각각 독립적으로 허용하거나 거부할 수 있습니다. 실용적인 지도를 정리했습니다.
중요한 크롤러들
| User-agent | 운영사 | 공급 대상 |
|---|---|---|
GPTBot | OpenAI | 모델 학습 및 ChatGPT 브라우징 코퍼스 |
OAI-SearchBot | OpenAI | ChatGPT 검색 결과(실시간 인용) |
ClaudeBot | Anthropic | Claude 학습 및 정보 검색 |
Claude-User | Anthropic | Claude 사용자/에이전트를 대신해 수행하는 페이지 가져오기 |
PerplexityBot | Perplexity | Perplexity 답변 엔진 색인(인용 출처) |
Google-Extended | Gemini 학습/그라운딩(Googlebot 순위와는 별개) | |
CCBot | Common Crawl | 다수의 연구/AI 프로젝트가 사용하는 공개 웹 코퍼스 |
Bytespider | ByteDance | 모델 학습 |
Baiduspider | Baidu | Baidu 검색 색인(중국 검색의 주요 관문) |
PetalBot | Huawei | Petal Search 색인 및 AI 기능 |
기본값이 아니라 의도적으로 결정하세요
일관된 3가지 정책 중 하나를 의도적으로 선택하세요:
1. 개방 (AI 화면에서 발견되도록 허용)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. 검색은 허용, 학습은 거부
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. 차단
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
어떤 정책을 선택하든 robots.txt에
Sitemap: 줄을 유지하세요. 그리고 robots.txt가 비어 있거나 없으면 규칙을 준수하는 크롤러에게는 "모두 허용"을 의미한다는 점을 기억하세요. 아무것도 하지 않는 것 역시 하나의 결정입니다.진단에 미치는 영향
저희의 30개 항목 진단은 robots.txt를 읽고 AI 크롤러에 대한 명시적 규칙이 있는지 보고합니다. 어느 방향을 선택하든 침묵은 의도적인 정책보다 낮은 점수를 받습니다. 에이전트와 그 운영자는 명확성에 보상을 주기 때문입니다.
자주 묻는 질문
- GPTBot을 차단해야 하나요?
- 이는 기술적 기본값이 아니라 비즈니스 결정입니다. 차단하면 ChatGPT 시대의 답변과 향후 학습에서 내 콘텐츠가 제외되고, 허용하면 콘텐츠를 내주는 대신 AI 화면에서의 가시성을 얻습니다. 발견되고 인용되기를 원하는 대부분의 비즈니스에는 검색/에이전트 크롤러를 허용하는 것이 실용적인 선택입니다.
- Google-Extended를 차단하면 Google 순위에 해가 되나요?
- 아니요. Google-Extended는 내 콘텐츠를 Gemini 학습과 그라운딩에 사용할지만 제어하며, 일반 Googlebot의 색인과 순위에는 영향을 주지 않습니다.
- AI 크롤러는 robots.txt를 준수하나요?
- 이름이 알려진 주요 크롤러(GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot)는 robots.txt 준수를 공개적으로 약속합니다. 이름 없는 스크레이퍼는 그렇지 않을 수 있습니다. robots.txt는 정책 신호일 뿐 강제 수단이 아닙니다.