เครื่องมือนี้ทำอะไร
ตัวสร้าง robots.txt เขียนไฟล์ robots.txt ที่บอกครอว์เลอร์ว่าดึงส่วนใดของเว็บไซต์ได้บ้าง เลือก user-agent ของกลุ่มกฎหลัก ระบุพาธที่ต้องการบล็อกและข้อยกเว้นที่อนุญาต เพิ่ม crawl-delay และ URL แผนผังเว็บไซต์หนึ่งรายการขึ้นไปหากต้องการ แล้วไฟล์จะอัปเดตทันทีขณะพิมพ์
ค่าที่ตั้งไว้ช่วยจัดการกรณีทั่วไปในคลิกเดียว ได้แก่ อนุญาตทั้งหมด, บล็อกทั้งหมด (เหมาะกับเว็บทดสอบ) และจุดเริ่มต้นสำหรับ WordPress การตั้งค่าแยกต่างหากใช้บล็อกครอว์เลอร์ AI เฉพาะที่ใช้ฝึกโมเดล หรือบล็อกทั้งหมดรวมถึงการค้นหาด้วย AI และเอเจนต์ของผู้ช่วย และยังบล็อกบอทอื่นตามชื่อได้ เช่น ครอว์เลอร์ SEO พาธ ชื่อ user-agent และ URL แผนผังเว็บไซต์จะถูกตรวจสอบ หากลืมเครื่องหมายทับนำหน้าหรือใช้ sitemap แบบสัมพัทธ์ เครื่องมือจะแจ้งเตือนแทนที่จะสร้างไฟล์ที่เสียโดยไม่บอก
วิธีใช้
- เริ่มจากค่าที่ตั้งไว้ หรือใช้ค่าเริ่มต้นที่อนุญาตทั้งหมด
- ใน พาธที่บล็อก ให้ระบุโฟลเดอร์หรือแพตเทิร์นที่ไม่ให้ครอว์เลอร์เข้า โดยคั่นด้วยจุลภาค เช่น
/admin/, /cart/, /*?sort=ข้อยกเว้นภายในให้ใส่ใน พาธที่อนุญาต - เพิ่ม URL แผนผังเว็บไซต์ เพื่อให้เสิร์ชเอนจินพบได้โดยไม่ต้องส่งแยก
- เลือกวิธีจัดการครอว์เลอร์ AI และเพิ่มบอทอื่นที่ต้องการบล็อก
- ดาวน์โหลดไฟล์เป็น
robots.txtแล้วอัปโหลดไว้ที่รากของโดเมน ให้เข้าถึงได้ที่https://example.com/robots.txtซับโดเมนแต่ละอันต้องมีไฟล์ของตัวเอง
ตัวอย่าง
บล็อก /admin/ โดยยกเว้น /admin/public/ เพิ่ม sitemap และบล็อกครอว์เลอร์ฝึก AI จะได้
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(กลุ่ม AI ในที่นี้ถูกย่อ เครื่องมือจะแสดงครอว์เลอร์ครบทุกตัว) บรรทัด User-agent หลายบรรทัดตามด้วยกฎจะรวมเป็นกลุ่มเดียวที่ใช้กับทุกตัว และครอว์เลอร์จะทำตามเฉพาะกลุ่มที่เจาะจงที่สุดที่ระบุชื่อตัวเอง
เคล็ดลับ
*ตรงกับลำดับอักขระใดก็ได้ และ$ระบุท้าย URL ดังนั้น/*.pdf$จะบล็อก PDF ทั้งหมด- เมื่อทั้ง Allow และ Disallow ตรงกัน Google จะใช้กฎที่ยาวที่สุด (เจาะจงที่สุด)
- อย่าบล็อกไฟล์ CSS และ JavaScript ที่หน้าเว็บต้องใช้ในการแสดงผล มิฉะนั้นเสิร์ชเอนจินอาจประเมินหน้าผิด
- ทดสอบการเปลี่ยนแปลงด้วยรายงาน robots.txt ใน Google Search Console ก่อนนำไปใช้จริง
คำถามที่พบบ่อย
› Disallow ใน robots.txt ลบหน้าออกจาก Google ได้หรือไม่
ไม่ได้ Disallow แค่ห้ามครอว์เลอร์ที่ทำตามกฎดึง URL นั้น แต่ URL ยังอาจถูกจัดทำดัชนี (โดยไม่มีข้อความย่อ) หากเว็บอื่นลิงก์มา หากต้องการไม่ให้หน้าปรากฏในผลการค้นหา ให้อนุญาตการครอว์ล แล้วใช้เมทาแท็ก robots แบบ noindex หรือเฮดเดอร์ X-Robots-Tag แทน
› เครื่องมือบล็อกครอว์เลอร์ AI ตัวใดบ้าง
บล็อกครอว์เลอร์สำหรับฝึกโมเดล จะเพิ่ม GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot และบอทอื่นที่เก็บข้อมูลไปฝึกโมเดล ส่วน บล็อกบอท AI ทั้งหมด จะเพิ่มตัวจัดทำดัชนีของการค้นหาด้วย AI และเอเจนต์ของผู้ช่วย AI เช่น OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot และ Perplexity-User ด้วย ซึ่งอาจทำให้หน้าของคุณไม่ถูกอ้างอิงในคำตอบของ AI
› ครอว์เลอร์ทุกตัวทำตาม robots.txt หรือไม่
เสิร์ชเอนจินที่น่าเชื่อถือและบริษัท AI รายใหญ่ระบุว่าทำตาม แต่ robots.txt เป็นเพียงธรรมเนียม ไม่ใช่การควบคุมการเข้าถึง สแครปเปอร์อาจเพิกเฉยได้ จึงควรป้องกันเนื้อหาส่วนตัวด้วยการยืนยันตัวตน และใช้กฎของเซิร์ฟเวอร์หรือไฟร์วอลล์กับบอทที่ก่อปัญหา
› รองรับ Crawl-delay หรือไม่
Bing, Yandex และครอว์เลอร์บางตัวเคารพ Crawl-delay ส่วน Google จะเพิกเฉยและปรับอัตราการครอว์ลเองตามความเร็วการตอบสนองของเซิร์ฟเวอร์