🌐 ไทย
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย
MarkosWebไดเรกทอรีความพร้อมสำหรับ AI เอเจนต์

รู้จัก AI ครอว์เลอร์ - และควรใส่อะไรใน robots.txt

ทุกวันนี้ครอว์เลอร์ที่ระบุชื่อเพียงหยิบมือเดียวเป็นผู้ตัดสินว่าเว็บไซต์ของคุณมีตัวตนในคำตอบของ AI หรือไม่ แต่ละตัวมีจุดประสงค์ต่างกัน ทั้งการฝึกโมเดล การค้นหาแบบสด หรือการท่องเว็บโดยเอเจนต์ และแต่ละตัวอนุญาตหรือปฏิเสธได้อย่างอิสระใน robots.txt นี่คือแผนที่เชิงปฏิบัติ

ครอว์เลอร์ที่สำคัญ

User-agentผู้ให้บริการป้อนข้อมูลให้อะไร
GPTBotOpenAIการฝึกโมเดลและคลังข้อมูลการท่องเว็บของ ChatGPT
OAI-SearchBotOpenAIผลการค้นหาของ ChatGPT (การอ้างอิงแบบสด)
ClaudeBotAnthropicการฝึกและการดึงข้อมูลของ Claude
Claude-UserAnthropicการดึงข้อมูลในนามของผู้ใช้หรือเอเจนต์ของ Claude
PerplexityBotPerplexityดัชนีเอนจินคำตอบของ Perplexity (แหล่งที่มาที่ถูกอ้างอิง)
Google-ExtendedGoogleการฝึกและ grounding ของ Gemini - แยกจากการจัดอันดับของ Googlebot
CCBotCommon Crawlคลังข้อมูลเว็บแบบเปิดที่โครงการวิจัยและ AI จำนวนมากใช้
BytespiderByteDanceการฝึกโมเดล
BaiduspiderBaiduดัชนีการค้นหาของ Baidu (ประตูหลักสู่การค้นหาในจีน)
PetalBotHuaweiดัชนี Petal Search และฟีเจอร์ AI

ตัดสินใจอย่างจงใจ ไม่ใช่ปล่อยตามค่าเริ่มต้น

นโยบายที่สอดคล้องกันมี 3 แบบ เลือกหนึ่งแบบอย่างตั้งใจ:

1. เปิด (ให้ถูกค้นพบบนพื้นที่แสดงผลของ AI)

# AI crawlers welcome
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

2. ค้นหาได้ แต่ห้ามใช้ฝึกโมเดล

# Allow live AI search/citation, refuse training corpora
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

3. ปิด

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
ไม่ว่าคุณจะเลือกแบบใด: คงบรรทัด Sitemap: ไว้ใน robots.txt และอย่าลืมว่า robots.txt ที่ว่างเปล่าหรือไม่มีอยู่หมายถึง "อนุญาตทุกอย่าง" สำหรับครอว์เลอร์ที่ปฏิบัติตามกติกา นั่นคือการตัดสินใจโดยการละเลย

ผลต่อการตรวจสอบของคุณ

การตรวจสอบ 30 รายการของเราอ่าน robots.txt ของคุณ และรายงานว่ามีกฎที่ชัดแจ้งสำหรับ AI ครอว์เลอร์หรือไม่ ความเงียบได้คะแนนต่ำกว่านโยบายที่จงใจกำหนด ไม่ว่าคุณจะเลือกทิศทางใด เพราะทั้งเอเจนต์และผู้ให้บริการเอเจนต์ต่างให้รางวัลแก่ความชัดเจน

ตรวจสอบ robots.txt และความพร้อมทั้งหมดของคุณตอนนี้

คำถามที่พบบ่อย

ควรบล็อก GPTBot หรือไม่
นี่คือการตัดสินใจทางธุรกิจ ไม่ใช่ค่าเริ่มต้นทางเทคนิค การบล็อกทำให้เนื้อหาของคุณหายไปจากคำตอบในยุค ChatGPT และการฝึกโมเดลในอนาคต ส่วนการอนุญาตคือการแลกเนื้อหากับการมองเห็นบนพื้นที่แสดงผลของ AI สำหรับธุรกิจส่วนใหญ่ที่ต้องการถูกค้นพบและถูกอ้างอิง การอนุญาตครอว์เลอร์ด้านการค้นหาและเอเจนต์คือทางเลือกที่ปฏิบัติได้จริง
การบล็อก Google-Extended กระทบอันดับใน Google หรือไม่
ไม่ Google-Extended ควบคุมเพียงการใช้เนื้อหาของคุณเพื่อการฝึกและ grounding ของ Gemini เท่านั้น การจัดทำดัชนีและการจัดอันดับตามปกติของ Googlebot ไม่ได้รับผลกระทบ
AI ครอว์เลอร์เคารพ robots.txt หรือไม่
ครอว์เลอร์รายใหญ่ที่ระบุชื่อ (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot) ให้คำมั่นต่อสาธารณะว่าจะเคารพ robots.txt ส่วนสเครเปอร์ที่ไม่ระบุชื่ออาจไม่ทำเช่นนั้น robots.txt คือสัญญาณเชิงนโยบาย ไม่ใช่กลไกบังคับ
English中文РусскийEspañolPortuguês日本語DeutschFrançais한국어TürkçeBahasa IndonesiaItalianoPolskiNederlandsČeštinaУкраїнськаTiếng Việtไทย