AI crawler: ใครมาดึงข้อมูลเว็บของคุณ และแต่ละโทเคนควบคุมอะไร
ทุกเอนจิน AI ที่ตอบคำถามเกี่ยวกับตลาดของคุณล้วนดึงเนื้อหาจากเว็บ และผู้ให้บริการแต่ละรายเผยแพร่โทเคน user agent ที่คุณจะอนุญาตหรือบล็อกใน robots.txt ได้ โทเคนเหล่านี้ใช้แทนกันไม่ได้ บางตัวป้อนการเทรนโมเดล บางตัวป้อนดัชนีค้นหาที่เอนจินใช้อ้างอิง และบางตัวดึงหน้าเว็บแบบสด ๆ เพราะผู้ใช้เพิ่งถามถึง บล็อกผิดตัวแล้วคุณจะเสียการมองเห็นไปโดยไม่ได้ปกป้องอะไรเลย
ตัวดึงข้อมูลสามประเภท
เอกสารของผู้ให้บริการแยกออกเป็นสามบทบาทอย่างชัดเจน crawler สำหรับเทรนเก็บเนื้อหาที่อาจถูกใช้เทรนโมเดลพื้นฐานรุ่นถัดไป crawler สำหรับค้นหาสร้างดัชนีที่เอนจินใช้ยึดโยงและอ้างอิงคำตอบ ส่วนตัวดึงที่ผู้ใช้กระตุ้นจะเข้าหน้าเว็บในจังหวะที่คำถามของผู้ใช้ต้องการ มีแค่บทบาทแรกเท่านั้นที่แตะเรื่องการเทรน และมีแค่สองบทบาทหลังที่ตัดสินว่าคุณจะปรากฏในคำตอบได้หรือไม่
OpenAI: GPTBot, OAI-SearchBot และ ChatGPT-User
OpenAI อธิบายบอทของตนตามเส้นแบ่งนี้พอดี GPTBot ไต่เก็บเนื้อหาเพื่อเทรนโมเดลพื้นฐานแบบ generative AI และการปฏิเสธมันหมายถึงการระบุว่าเนื้อหาของคุณไม่ควรถูกใช้ในการเทรนนั้น OAI-SearchBot ใช้เพื่อนำเว็บไซต์ขึ้นมาแสดงในฟีเจอร์ค้นหาของ ChatGPT และ OpenAI ระบุว่าเว็บไซต์ที่เลือกปฏิเสธมันจะไม่ถูกแสดงในคำตอบการค้นหาของ ChatGPT ส่วน ChatGPT-User ดึงข้อมูลตามการกระทำของผู้ใช้ใน ChatGPT และ Custom GPTs เนื่องจากผู้ใช้เป็นคนเริ่ม OpenAI จึงระบุว่ากฎใน robots.txt อาจไม่มีผล และเอเจนต์ตัวนี้ไม่ได้เป็นตัวกำหนดการถูกรวมในการค้นหา ประเด็นในทางปฏิบัติคือ การบล็อก GPTBot ไม่ได้ทำให้คุณหายไปจากการค้นหาของ ChatGPT แต่การบล็อก OAI-SearchBot ทำ
Anthropic: ClaudeBot, Claude-SearchBot และ Claude-User
Anthropic อธิบายเอเจนต์สามตัวด้วยการแบ่งหน้าที่แบบเดียวกัน ClaudeBot เก็บเนื้อหาเว็บที่อาจนำไปใช้ในการเทรนโมเดล และการปฏิเสธมันเป็นสัญญาณว่าเนื้อหาในอนาคตของคุณควรถูกกันออกจากชุดข้อมูลเทรน Claude-SearchBot วิเคราะห์เนื้อหาเพื่อปรับปรุงความเกี่ยวข้องและความแม่นยำของคำตอบการค้นหา การบล็อกมันอาจลดการมองเห็นของคุณในผลลัพธ์เหล่านั้น ส่วน Claude-User ดึงหน้าเว็บเมื่อมีคนถามคำถามกับ Claude และการบล็อกมันจะกันไม่ให้เนื้อหาของคุณถูกดึงมาตอบคำถามของผู้ใช้
Perplexity: PerplexityBot และ Perplexity-User
เอกสาร crawler ของ Perplexityระบุว่า PerplexityBot มีไว้เพื่อนำเว็บไซต์ขึ้นมาแสดงและลิงก์ในผลการค้นหาของ Perplexity และไม่ได้ใช้ไต่เก็บเนื้อหาสำหรับโมเดลพื้นฐานของ AI การบล็อกมันจึงไม่ได้ป้องกันอะไรในฝั่งการเทรน มันแค่ทำให้คุณเสียการปรากฏในผลลัพธ์ของ Perplexity ส่วน Perplexity-User รองรับการกระทำของผู้ใช้และโดยทั่วไปไม่สนใจกฎใน robots.txt เพราะผู้ใช้เป็นคนร้องขอให้ดึง มันก็เช่นกันที่ไม่ได้ถูกใช้เพื่อการเทรน
Google: Googlebot และ Google-Extended
Google-Extended คือโทเคนที่ถูกเข้าใจผิดมากที่สุดในรายการนี้ ตามเอกสาร crawler ของ Google มันไม่ใช่ crawler แยกต่างหากเลย การไต่เก็บเกิดขึ้นภายใต้ user agent ของ Google ที่มีอยู่แล้ว และ Google-Extended เป็นโทเคนใน robots.txt ที่ใช้ในเชิงควบคุม มันควบคุมว่าเนื้อหาที่ถูกไต่เก็บจะถูกนำไปใช้เทรนโมเดล Gemini ในอนาคตและใช้ยึดโยงใน Gemini Apps และ Grounding with Google Search บน Vertex AI ได้หรือไม่ Google ระบุอย่างชัดเจนว่ามันไม่มีผลต่อการที่เว็บไซต์ถูกรวมอยู่ใน Google Search และไม่ใช่สัญญาณจัดอันดับ ฟีเจอร์ AI ภายใน Search อยู่ภายใต้ตัวควบคุม Search ปกติที่ใช้กับ Googlebot ไม่ใช่ Google-Extended การบล็อก Google-Extended กันเนื้อหาของคุณออกจากการเทรน Gemini ส่วนการบล็อก Googlebot ตัดคุณออกจาก Search และทุกอย่างที่สร้างบนมัน
ข้อแลกเปลี่ยน โทเคนต่อโทเคน
| โทเคน | บล็อกแล้วหยุดอะไร | บล็อกแล้วเสียอะไร |
|---|---|---|
| GPTBot | การนำเนื้อหาของคุณไปเทรนโมเดลของ OpenAI | ไม่มีผลที่ระบุไว้ต่อการค้นหาของ ChatGPT |
| OAI-SearchBot | การถูกรวมในการค้นหาของ ChatGPT | การถูกแสดงในคำตอบการค้นหาของ ChatGPT |
| ChatGPT-User | แทบไม่มี robots.txt อาจไม่มีผลกับการกระทำของผู้ใช้ | การดึงหน้าเว็บของคุณที่ผู้ใช้เป็นคนเริ่ม |
| ClaudeBot | การนำเนื้อหาของคุณไปเทรนโมเดลของ Anthropic | ไม่มีอะไรที่ระบุไว้ในฝั่งการค้นหา |
| Claude-SearchBot | การจัดทำดัชนีสำหรับคำตอบการค้นหาของ Claude | การมองเห็นในคำตอบเหล่านั้น |
| Claude-User | การดึงข้อมูลสำหรับคำถามของผู้ใช้แต่ละราย | การมองเห็นในการค้นหาเว็บที่ผู้ใช้สั่ง |
| PerplexityBot | ไม่มีอะไรในฝั่งการเทรน มันเป็นบอทค้นหา | การปรากฏในผลลัพธ์ของ Perplexity |
| Google-Extended | การเทรน Gemini และการใช้ยึดโยงตามที่ระบุไว้ | ไม่มีอะไรใน Google Search ตามที่ Google ระบุ |
| Googlebot | ตัว Google Search เอง | การมองเห็นในการค้นหาและฟีเจอร์ AI ที่สร้างบนมัน |
วิธีตัดสินใจที่สะอาดคือ โทเคนสำหรับการเทรนเป็นทางเลือกเชิงนโยบายที่คุณเลือกทางไหนก็ได้ ขณะที่โทเคนสำหรับการค้นหาและสำหรับผู้ใช้เป็นทางเลือกเชิงรายได้ เพราะเอนจินที่ดึงข้อมูลคุณไม่ได้ก็อ้างอิงคุณไม่ได้ การตรวจสอบว่า crawler ที่ดึงข้อมูลเข้าถึงหน้าเว็บของคุณได้จริงเป็นเรื่องของSEO เชิงเทคนิค และสิ่งที่พวกมันทำกับเนื้อหาของคุณหลังจากได้ไปแล้วอธิบายไว้ในGEO คืออะไร