Skip to main content
All pages in this guide
แหล่งความรู้

Last updated

AI crawler: ใครมาดึงข้อมูลเว็บของคุณ และแต่ละโทเคนควบคุมอะไร

ทุกเอนจิน AI ที่ตอบคำถามเกี่ยวกับตลาดของคุณล้วนดึงเนื้อหาจากเว็บ และผู้ให้บริการแต่ละรายเผยแพร่โทเคน user agent ที่คุณจะอนุญาตหรือบล็อกใน robots.txt ได้ โทเคนเหล่านี้ใช้แทนกันไม่ได้ บางตัวป้อนการเทรนโมเดล บางตัวป้อนดัชนีค้นหาที่เอนจินใช้อ้างอิง และบางตัวดึงหน้าเว็บแบบสด ๆ เพราะผู้ใช้เพิ่งถามถึง บล็อกผิดตัวแล้วคุณจะเสียการมองเห็นไปโดยไม่ได้ปกป้องอะไรเลย

ตัวดึงข้อมูลสามประเภท

เอกสารของผู้ให้บริการแยกออกเป็นสามบทบาทอย่างชัดเจน crawler สำหรับเทรนเก็บเนื้อหาที่อาจถูกใช้เทรนโมเดลพื้นฐานรุ่นถัดไป crawler สำหรับค้นหาสร้างดัชนีที่เอนจินใช้ยึดโยงและอ้างอิงคำตอบ ส่วนตัวดึงที่ผู้ใช้กระตุ้นจะเข้าหน้าเว็บในจังหวะที่คำถามของผู้ใช้ต้องการ มีแค่บทบาทแรกเท่านั้นที่แตะเรื่องการเทรน และมีแค่สองบทบาทหลังที่ตัดสินว่าคุณจะปรากฏในคำตอบได้หรือไม่

OpenAI: GPTBot, OAI-SearchBot และ ChatGPT-User

OpenAI อธิบายบอทของตนตามเส้นแบ่งนี้พอดี GPTBot ไต่เก็บเนื้อหาเพื่อเทรนโมเดลพื้นฐานแบบ generative AI และการปฏิเสธมันหมายถึงการระบุว่าเนื้อหาของคุณไม่ควรถูกใช้ในการเทรนนั้น OAI-SearchBot ใช้เพื่อนำเว็บไซต์ขึ้นมาแสดงในฟีเจอร์ค้นหาของ ChatGPT และ OpenAI ระบุว่าเว็บไซต์ที่เลือกปฏิเสธมันจะไม่ถูกแสดงในคำตอบการค้นหาของ ChatGPT ส่วน ChatGPT-User ดึงข้อมูลตามการกระทำของผู้ใช้ใน ChatGPT และ Custom GPTs เนื่องจากผู้ใช้เป็นคนเริ่ม OpenAI จึงระบุว่ากฎใน robots.txt อาจไม่มีผล และเอเจนต์ตัวนี้ไม่ได้เป็นตัวกำหนดการถูกรวมในการค้นหา ประเด็นในทางปฏิบัติคือ การบล็อก GPTBot ไม่ได้ทำให้คุณหายไปจากการค้นหาของ ChatGPT แต่การบล็อก OAI-SearchBot ทำ

Anthropic: ClaudeBot, Claude-SearchBot และ Claude-User

Anthropic อธิบายเอเจนต์สามตัวด้วยการแบ่งหน้าที่แบบเดียวกัน ClaudeBot เก็บเนื้อหาเว็บที่อาจนำไปใช้ในการเทรนโมเดล และการปฏิเสธมันเป็นสัญญาณว่าเนื้อหาในอนาคตของคุณควรถูกกันออกจากชุดข้อมูลเทรน Claude-SearchBot วิเคราะห์เนื้อหาเพื่อปรับปรุงความเกี่ยวข้องและความแม่นยำของคำตอบการค้นหา การบล็อกมันอาจลดการมองเห็นของคุณในผลลัพธ์เหล่านั้น ส่วน Claude-User ดึงหน้าเว็บเมื่อมีคนถามคำถามกับ Claude และการบล็อกมันจะกันไม่ให้เนื้อหาของคุณถูกดึงมาตอบคำถามของผู้ใช้

Perplexity: PerplexityBot และ Perplexity-User

เอกสาร crawler ของ Perplexityระบุว่า PerplexityBot มีไว้เพื่อนำเว็บไซต์ขึ้นมาแสดงและลิงก์ในผลการค้นหาของ Perplexity และไม่ได้ใช้ไต่เก็บเนื้อหาสำหรับโมเดลพื้นฐานของ AI การบล็อกมันจึงไม่ได้ป้องกันอะไรในฝั่งการเทรน มันแค่ทำให้คุณเสียการปรากฏในผลลัพธ์ของ Perplexity ส่วน Perplexity-User รองรับการกระทำของผู้ใช้และโดยทั่วไปไม่สนใจกฎใน robots.txt เพราะผู้ใช้เป็นคนร้องขอให้ดึง มันก็เช่นกันที่ไม่ได้ถูกใช้เพื่อการเทรน

Google: Googlebot และ Google-Extended

Google-Extended คือโทเคนที่ถูกเข้าใจผิดมากที่สุดในรายการนี้ ตามเอกสาร crawler ของ Google มันไม่ใช่ crawler แยกต่างหากเลย การไต่เก็บเกิดขึ้นภายใต้ user agent ของ Google ที่มีอยู่แล้ว และ Google-Extended เป็นโทเคนใน robots.txt ที่ใช้ในเชิงควบคุม มันควบคุมว่าเนื้อหาที่ถูกไต่เก็บจะถูกนำไปใช้เทรนโมเดล Gemini ในอนาคตและใช้ยึดโยงใน Gemini Apps และ Grounding with Google Search บน Vertex AI ได้หรือไม่ Google ระบุอย่างชัดเจนว่ามันไม่มีผลต่อการที่เว็บไซต์ถูกรวมอยู่ใน Google Search และไม่ใช่สัญญาณจัดอันดับ ฟีเจอร์ AI ภายใน Search อยู่ภายใต้ตัวควบคุม Search ปกติที่ใช้กับ Googlebot ไม่ใช่ Google-Extended การบล็อก Google-Extended กันเนื้อหาของคุณออกจากการเทรน Gemini ส่วนการบล็อก Googlebot ตัดคุณออกจาก Search และทุกอย่างที่สร้างบนมัน

ข้อแลกเปลี่ยน โทเคนต่อโทเคน

โทเคนบล็อกแล้วหยุดอะไรบล็อกแล้วเสียอะไร
GPTBotการนำเนื้อหาของคุณไปเทรนโมเดลของ OpenAIไม่มีผลที่ระบุไว้ต่อการค้นหาของ ChatGPT
OAI-SearchBotการถูกรวมในการค้นหาของ ChatGPTการถูกแสดงในคำตอบการค้นหาของ ChatGPT
ChatGPT-Userแทบไม่มี robots.txt อาจไม่มีผลกับการกระทำของผู้ใช้การดึงหน้าเว็บของคุณที่ผู้ใช้เป็นคนเริ่ม
ClaudeBotการนำเนื้อหาของคุณไปเทรนโมเดลของ Anthropicไม่มีอะไรที่ระบุไว้ในฝั่งการค้นหา
Claude-SearchBotการจัดทำดัชนีสำหรับคำตอบการค้นหาของ Claudeการมองเห็นในคำตอบเหล่านั้น
Claude-Userการดึงข้อมูลสำหรับคำถามของผู้ใช้แต่ละรายการมองเห็นในการค้นหาเว็บที่ผู้ใช้สั่ง
PerplexityBotไม่มีอะไรในฝั่งการเทรน มันเป็นบอทค้นหาการปรากฏในผลลัพธ์ของ Perplexity
Google-Extendedการเทรน Gemini และการใช้ยึดโยงตามที่ระบุไว้ไม่มีอะไรใน Google Search ตามที่ Google ระบุ
Googlebotตัว Google Search เองการมองเห็นในการค้นหาและฟีเจอร์ AI ที่สร้างบนมัน

วิธีตัดสินใจที่สะอาดคือ โทเคนสำหรับการเทรนเป็นทางเลือกเชิงนโยบายที่คุณเลือกทางไหนก็ได้ ขณะที่โทเคนสำหรับการค้นหาและสำหรับผู้ใช้เป็นทางเลือกเชิงรายได้ เพราะเอนจินที่ดึงข้อมูลคุณไม่ได้ก็อ้างอิงคุณไม่ได้ การตรวจสอบว่า crawler ที่ดึงข้อมูลเข้าถึงหน้าเว็บของคุณได้จริงเป็นเรื่องของSEO เชิงเทคนิค และสิ่งที่พวกมันทำกับเนื้อหาของคุณหลังจากได้ไปแล้วอธิบายไว้ในGEO คืออะไร

ให้ทำงานแบบออโตไพลอต

Vupie ทำทุกอย่างในคู่มือนี้ให้คุณ แปดบทความพรีเมียมต่อเดือน

เข้าร่วมเบต้า