รู้จัก AI ครอว์เลอร์ - และควรใส่อะไรใน robots.txt
ทุกวันนี้ครอว์เลอร์ที่ระบุชื่อเพียงหยิบมือเดียวเป็นผู้ตัดสินว่าเว็บไซต์ของคุณมีตัวตนในคำตอบของ AI หรือไม่ แต่ละตัวมีจุดประสงค์ต่างกัน ทั้งการฝึกโมเดล การค้นหาแบบสด หรือการท่องเว็บโดยเอเจนต์ และแต่ละตัวอนุญาตหรือปฏิเสธได้อย่างอิสระใน robots.txt นี่คือแผนที่เชิงปฏิบัติ
ครอว์เลอร์ที่สำคัญ
| User-agent | ผู้ให้บริการ | ป้อนข้อมูลให้อะไร |
|---|---|---|
GPTBot | OpenAI | การฝึกโมเดลและคลังข้อมูลการท่องเว็บของ ChatGPT |
OAI-SearchBot | OpenAI | ผลการค้นหาของ ChatGPT (การอ้างอิงแบบสด) |
ClaudeBot | Anthropic | การฝึกและการดึงข้อมูลของ Claude |
Claude-User | Anthropic | การดึงข้อมูลในนามของผู้ใช้หรือเอเจนต์ของ Claude |
PerplexityBot | Perplexity | ดัชนีเอนจินคำตอบของ Perplexity (แหล่งที่มาที่ถูกอ้างอิง) |
Google-Extended | การฝึกและ grounding ของ Gemini - แยกจากการจัดอันดับของ Googlebot | |
CCBot | Common Crawl | คลังข้อมูลเว็บแบบเปิดที่โครงการวิจัยและ AI จำนวนมากใช้ |
Bytespider | ByteDance | การฝึกโมเดล |
Baiduspider | Baidu | ดัชนีการค้นหาของ Baidu (ประตูหลักสู่การค้นหาในจีน) |
PetalBot | Huawei | ดัชนี Petal Search และฟีเจอร์ AI |
ตัดสินใจอย่างจงใจ ไม่ใช่ปล่อยตามค่าเริ่มต้น
นโยบายที่สอดคล้องกันมี 3 แบบ เลือกหนึ่งแบบอย่างตั้งใจ:
1. เปิด (ให้ถูกค้นพบบนพื้นที่แสดงผลของ AI)
# AI crawlers welcome
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
2. ค้นหาได้ แต่ห้ามใช้ฝึกโมเดล
# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
3. ปิด
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
ไม่ว่าคุณจะเลือกแบบใด: คงบรรทัด
Sitemap: ไว้ใน robots.txt และอย่าลืมว่า robots.txt ที่ว่างเปล่าหรือไม่มีอยู่หมายถึง "อนุญาตทุกอย่าง" สำหรับครอว์เลอร์ที่ปฏิบัติตามกติกา นั่นคือการตัดสินใจโดยการละเลยผลต่อการตรวจสอบของคุณ
การตรวจสอบ 30 รายการของเราอ่าน robots.txt ของคุณ และรายงานว่ามีกฎที่ชัดแจ้งสำหรับ AI ครอว์เลอร์หรือไม่ ความเงียบได้คะแนนต่ำกว่านโยบายที่จงใจกำหนด ไม่ว่าคุณจะเลือกทิศทางใด เพราะทั้งเอเจนต์และผู้ให้บริการเอเจนต์ต่างให้รางวัลแก่ความชัดเจน
ตรวจสอบ robots.txt และความพร้อมทั้งหมดของคุณตอนนี้
คำถามที่พบบ่อย
- ควรบล็อก GPTBot หรือไม่
- นี่คือการตัดสินใจทางธุรกิจ ไม่ใช่ค่าเริ่มต้นทางเทคนิค การบล็อกทำให้เนื้อหาของคุณหายไปจากคำตอบในยุค ChatGPT และการฝึกโมเดลในอนาคต ส่วนการอนุญาตคือการแลกเนื้อหากับการมองเห็นบนพื้นที่แสดงผลของ AI สำหรับธุรกิจส่วนใหญ่ที่ต้องการถูกค้นพบและถูกอ้างอิง การอนุญาตครอว์เลอร์ด้านการค้นหาและเอเจนต์คือทางเลือกที่ปฏิบัติได้จริง
- การบล็อก Google-Extended กระทบอันดับใน Google หรือไม่
- ไม่ Google-Extended ควบคุมเพียงการใช้เนื้อหาของคุณเพื่อการฝึกและ grounding ของ Gemini เท่านั้น การจัดทำดัชนีและการจัดอันดับตามปกติของ Googlebot ไม่ได้รับผลกระทบ
- AI ครอว์เลอร์เคารพ robots.txt หรือไม่
- ครอว์เลอร์รายใหญ่ที่ระบุชื่อ (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) ให้คำมั่นต่อสาธารณะว่าจะเคารพ robots.txt ส่วนสเครเปอร์ที่ไม่ระบุชื่ออาจไม่ทำเช่นนั้น robots.txt คือสัญญาณเชิงนโยบาย ไม่ใช่กลไกบังคับ