DevToolPal
ID

Generator robots.txt

Buat file robots.txt: izinkan atau blokir path per user-agent, tambahkan sitemap dan crawl-delay, serta blokir crawler AI dengan sekali klik.

Berjalan lokal, tidak pernah diunggah

Opsi

robots.txt

0 karakter · 0 B

Apa yang dilakukan alat ini

Generator robots.txt menulis file robots.txt yang memberi tahu crawler bagian mana dari situs Anda yang boleh diambil. Pilih user-agent untuk grup aturan utama, daftarkan path yang ingin diblokir dan pengecualian yang diizinkan, tambahkan crawl-delay serta satu atau beberapa URL sitemap bila perlu, dan file diperbarui saat Anda mengetik.

Preset menangani kasus umum dengan sekali klik: Izinkan semua, Blokir semua (berguna untuk situs staging), dan titik awal untuk WordPress. Pengaturan terpisah memblokir crawler AI hanya untuk pelatihan atau sepenuhnya, termasuk penelusuran AI dan agen asisten, dan Anda dapat memblokir bot lain berdasarkan nama, seperti crawler SEO. Path, nama user-agent, dan URL sitemap diperiksa, sehingga garis miring awal yang terlupa atau sitemap relatif dilaporkan alih-alih diam-diam menghasilkan file yang rusak.

Cara menggunakan

  1. Mulai dari preset atau pertahankan bawaan yang mengizinkan semuanya.
  2. Di Path yang diblokir, tuliskan folder atau pola yang tidak boleh dimasuki crawler, dipisahkan koma, misalnya /admin/, /cart/, /*?sort=. Gunakan Path yang diizinkan untuk pengecualian di dalamnya.
  3. Tambahkan URL sitemap agar mesin pencari menemukannya tanpa dikirim terpisah.
  4. Pilih cara memperlakukan crawler AI dan tambahkan bot lain yang ingin diblokir.
  5. Unduh file sebagai robots.txt dan unggah ke akar domain Anda agar tersedia di https://example.com/robots.txt. Setiap subdomain memerlukan file sendiri.

Contoh

Memblokir /admin/ dengan pengecualian untuk /admin/public/, menambahkan sitemap, dan memblokir crawler pelatihan AI menghasilkan:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Grup AI di sini diringkas; alat ini mencantumkan semua crawler.) Beberapa baris User-agent yang diikuti aturan membentuk satu grup yang berlaku untuk semuanya, dan setiap crawler hanya mengikuti grup paling spesifik yang menyebut namanya.

Tips

  • * cocok dengan urutan karakter apa pun dan $ menandai akhir URL, jadi /*.pdf$ memblokir semua PDF.
  • Jika Allow dan Disallow sama-sama cocok, Google menerapkan aturan terpanjang (paling spesifik).
  • Jangan blokir file CSS dan JavaScript yang dibutuhkan halaman untuk dirender, atau mesin pencari bisa salah menilai halaman Anda.
  • Uji perubahan dengan laporan robots.txt di Google Search Console sebelum mengandalkannya.

FAQ

› Apakah Disallow di robots.txt menghapus halaman dari Google?

Tidak. Disallow mencegah crawler yang patuh mengambil sebuah URL, tetapi URL itu tetap bisa diindeks (tanpa cuplikan) jika situs lain menautkannya. Agar halaman tidak muncul di hasil penelusuran, biarkan halaman di-crawl lalu gunakan tag meta robots noindex atau header X-Robots-Tag.

› Crawler AI apa saja yang diblokir alat ini?

Blokir crawler pelatihan menambahkan GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot, dan bot lain yang mengumpulkan data untuk melatih model. Blokir semua bot AI juga menambahkan pengindeks penelusuran AI dan agen asisten seperti OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, dan Perplexity-User, yang bisa membuat halaman Anda tidak lagi dikutip dalam jawaban AI.

› Apakah semua crawler mematuhi robots.txt?

Mesin pencari tepercaya dan perusahaan AI besar menyatakan mematuhinya, tetapi robots.txt hanyalah konvensi, bukan kontrol akses. Scraper bisa mengabaikannya, jadi lindungi konten privat dengan autentikasi dan gunakan aturan server atau firewall untuk bot yang mengganggu.

› Apakah Crawl-delay didukung?

Bing, Yandex, dan beberapa crawler lain mematuhi Crawl-delay; Google mengabaikannya dan menyesuaikan laju crawl secara otomatis berdasarkan kecepatan respons server Anda.