DevToolPal
ไทย

ตัวสร้าง robots.txt

สร้างไฟล์ robots.txt: อนุญาตหรือบล็อกพาธตาม user-agent เพิ่มแผนผังเว็บไซต์และ crawl-delay และบล็อกครอว์เลอร์ AI ได้ในคลิกเดียว

ทำงานในเครื่อง ไม่มีการอัปโหลด

ตัวเลือก

robots.txt

0 ตัวอักษร · 0 B

เครื่องมือนี้ทำอะไร

ตัวสร้าง robots.txt เขียนไฟล์ robots.txt ที่บอกครอว์เลอร์ว่าดึงส่วนใดของเว็บไซต์ได้บ้าง เลือก user-agent ของกลุ่มกฎหลัก ระบุพาธที่ต้องการบล็อกและข้อยกเว้นที่อนุญาต เพิ่ม crawl-delay และ URL แผนผังเว็บไซต์หนึ่งรายการขึ้นไปหากต้องการ แล้วไฟล์จะอัปเดตทันทีขณะพิมพ์

ค่าที่ตั้งไว้ช่วยจัดการกรณีทั่วไปในคลิกเดียว ได้แก่ อนุญาตทั้งหมด, บล็อกทั้งหมด (เหมาะกับเว็บทดสอบ) และจุดเริ่มต้นสำหรับ WordPress การตั้งค่าแยกต่างหากใช้บล็อกครอว์เลอร์ AI เฉพาะที่ใช้ฝึกโมเดล หรือบล็อกทั้งหมดรวมถึงการค้นหาด้วย AI และเอเจนต์ของผู้ช่วย และยังบล็อกบอทอื่นตามชื่อได้ เช่น ครอว์เลอร์ SEO พาธ ชื่อ user-agent และ URL แผนผังเว็บไซต์จะถูกตรวจสอบ หากลืมเครื่องหมายทับนำหน้าหรือใช้ sitemap แบบสัมพัทธ์ เครื่องมือจะแจ้งเตือนแทนที่จะสร้างไฟล์ที่เสียโดยไม่บอก

วิธีใช้

  1. เริ่มจากค่าที่ตั้งไว้ หรือใช้ค่าเริ่มต้นที่อนุญาตทั้งหมด
  2. ใน พาธที่บล็อก ให้ระบุโฟลเดอร์หรือแพตเทิร์นที่ไม่ให้ครอว์เลอร์เข้า โดยคั่นด้วยจุลภาค เช่น /admin/, /cart/, /*?sort= ข้อยกเว้นภายในให้ใส่ใน พาธที่อนุญาต
  3. เพิ่ม URL แผนผังเว็บไซต์ เพื่อให้เสิร์ชเอนจินพบได้โดยไม่ต้องส่งแยก
  4. เลือกวิธีจัดการครอว์เลอร์ AI และเพิ่มบอทอื่นที่ต้องการบล็อก
  5. ดาวน์โหลดไฟล์เป็น robots.txt แล้วอัปโหลดไว้ที่รากของโดเมน ให้เข้าถึงได้ที่ https://example.com/robots.txt ซับโดเมนแต่ละอันต้องมีไฟล์ของตัวเอง

ตัวอย่าง

บล็อก /admin/ โดยยกเว้น /admin/public/ เพิ่ม sitemap และบล็อกครอว์เลอร์ฝึก AI จะได้

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(กลุ่ม AI ในที่นี้ถูกย่อ เครื่องมือจะแสดงครอว์เลอร์ครบทุกตัว) บรรทัด User-agent หลายบรรทัดตามด้วยกฎจะรวมเป็นกลุ่มเดียวที่ใช้กับทุกตัว และครอว์เลอร์จะทำตามเฉพาะกลุ่มที่เจาะจงที่สุดที่ระบุชื่อตัวเอง

เคล็ดลับ

  • * ตรงกับลำดับอักขระใดก็ได้ และ $ ระบุท้าย URL ดังนั้น /*.pdf$ จะบล็อก PDF ทั้งหมด
  • เมื่อทั้ง Allow และ Disallow ตรงกัน Google จะใช้กฎที่ยาวที่สุด (เจาะจงที่สุด)
  • อย่าบล็อกไฟล์ CSS และ JavaScript ที่หน้าเว็บต้องใช้ในการแสดงผล มิฉะนั้นเสิร์ชเอนจินอาจประเมินหน้าผิด
  • ทดสอบการเปลี่ยนแปลงด้วยรายงาน robots.txt ใน Google Search Console ก่อนนำไปใช้จริง

คำถามที่พบบ่อย

› Disallow ใน robots.txt ลบหน้าออกจาก Google ได้หรือไม่

ไม่ได้ Disallow แค่ห้ามครอว์เลอร์ที่ทำตามกฎดึง URL นั้น แต่ URL ยังอาจถูกจัดทำดัชนี (โดยไม่มีข้อความย่อ) หากเว็บอื่นลิงก์มา หากต้องการไม่ให้หน้าปรากฏในผลการค้นหา ให้อนุญาตการครอว์ล แล้วใช้เมทาแท็ก robots แบบ noindex หรือเฮดเดอร์ X-Robots-Tag แทน

› เครื่องมือบล็อกครอว์เลอร์ AI ตัวใดบ้าง

บล็อกครอว์เลอร์สำหรับฝึกโมเดล จะเพิ่ม GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot และบอทอื่นที่เก็บข้อมูลไปฝึกโมเดล ส่วน บล็อกบอท AI ทั้งหมด จะเพิ่มตัวจัดทำดัชนีของการค้นหาด้วย AI และเอเจนต์ของผู้ช่วย AI เช่น OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot และ Perplexity-User ด้วย ซึ่งอาจทำให้หน้าของคุณไม่ถูกอ้างอิงในคำตอบของ AI

› ครอว์เลอร์ทุกตัวทำตาม robots.txt หรือไม่

เสิร์ชเอนจินที่น่าเชื่อถือและบริษัท AI รายใหญ่ระบุว่าทำตาม แต่ robots.txt เป็นเพียงธรรมเนียม ไม่ใช่การควบคุมการเข้าถึง สแครปเปอร์อาจเพิกเฉยได้ จึงควรป้องกันเนื้อหาส่วนตัวด้วยการยืนยันตัวตน และใช้กฎของเซิร์ฟเวอร์หรือไฟร์วอลล์กับบอทที่ก่อปัญหา

› รองรับ Crawl-delay หรือไม่

Bing, Yandex และครอว์เลอร์บางตัวเคารพ Crawl-delay ส่วน Google จะเพิกเฉยและปรับอัตราการครอว์ลเองตามความเร็วการตอบสนองของเซิร์ฟเวอร์