DevToolPal
NL

Robots.txt-generator

Maak een robots.txt: sta paden per user-agent toe of blokkeer ze, voeg je sitemap en crawl-delay toe en blokkeer AI-crawlers met één klik.

Draait lokaal, wordt nooit geüpload

Opties

robots.txt

0 tekens · 0 B

Wat de tool doet

De robots.txt-generator schrijft het bestand robots.txt dat crawlers vertelt welke delen van je site ze mogen ophalen. Kies de user-agents voor de hoofdgroep, noem de paden die je wilt blokkeren en de toegestane uitzonderingen, voeg eventueel een crawl-delay en een of meer sitemap-URL’s toe, en het bestand wordt bijgewerkt terwijl je typt.

Voorinstellingen regelen de gangbare gevallen met één klik: Alles toestaan, Alles blokkeren (handig voor stagingsites) en een startpunt voor WordPress. Een aparte instelling blokkeert AI-crawlers alleen voor training of volledig, inclusief AI-zoekmachines en ophaalagenten van assistenten, en je kunt elke andere bot, zoals SEO-crawlers, op naam blokkeren. Paden, user-agents en sitemap-URL’s worden gecontroleerd, zodat een vergeten slash vooraan of een relatieve sitemap wordt gemeld in plaats van stilletjes een kapot bestand op te leveren.

Zo gebruik je het

  1. Begin met een voorinstelling of houd de standaard, die alles toestaat.
  2. Noem bij Geblokkeerde paden de mappen of patronen waar crawlers weg moeten blijven, gescheiden door komma’s, zoals /admin/, /cart/, /*?sort=. Gebruik Toegestane paden voor uitzonderingen daarbinnen.
  3. Voeg je sitemap-URL toe, zodat zoekmachines die vinden zonder aparte aanmelding.
  4. Kies hoe je met AI-crawlers omgaat en voeg andere bots toe die je wilt blokkeren.
  5. Download het bestand als robots.txt en zet het in de hoofdmap van je domein, zodat het te vinden is op https://example.com/robots.txt. Elk subdomein heeft een eigen bestand nodig.

Voorbeeld

/admin/ blokkeren met een uitzondering voor /admin/public/, een sitemap toevoegen en AI-trainingscrawlers blokkeren levert op:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(De AI-groep is hier ingekort; de tool noemt alle crawlers.) Meerdere User-agent-regels gevolgd door regels vormen één groep die voor allemaal geldt, en een crawler volgt alleen de meest specifieke groep waarin hij genoemd wordt.

Tips

  • * matcht elke reeks tekens en $ verankert het einde van de URL, dus /*.pdf$ blokkeert alle pdf’s.
  • Als zowel Allow als Disallow matchen, past Google de langste (meest specifieke) regel toe.
  • Blokkeer geen CSS- en JavaScript-bestanden die pagina’s nodig hebben om te renderen, anders beoordelen zoekmachines ze mogelijk verkeerd.
  • Test wijzigingen met het robots.txt-rapport in Google Search Console voordat je erop vertrouwt.

Veelgestelde vragen

› Haalt Disallow in robots.txt een pagina uit Google?

Nee. Disallow houdt nette crawlers tegen om een URL op te halen, maar de URL kan nog steeds (zonder fragment) worden geïndexeerd als andere sites ernaar linken. Wil je een pagina uit de zoekresultaten houden, laat haar dan crawlen en gebruik de robots-metatag noindex of de header X-Robots-Tag.

› Welke AI-crawlers blokkeert de tool?

Trainingscrawlers blokkeren voegt GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot en andere bots toe die data verzamelen om modellen te trainen. Alle AI-bots blokkeren voegt daarnaast AI-zoekindexeerders en ophaalagenten van assistenten toe, zoals OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot en Perplexity-User, waardoor je pagina’s mogelijk niet meer in AI-antwoorden worden geciteerd.

› Houden alle crawlers zich aan robots.txt?

Betrouwbare zoekmachines en de grote AI-bedrijven zeggen dat ze het respecteren, maar robots.txt is een afspraak, geen toegangscontrole. Scrapers kunnen het negeren, dus bescherm privé-inhoud met inloggen en gebruik serverregels of een firewall tegen lastige bots.

› Wordt Crawl-delay ondersteund?

Bing, Yandex en enkele andere crawlers respecteren Crawl-delay; Google negeert het en past zijn crawlsnelheid automatisch aan op hoe snel je server reageert.