DevToolPal
DE

robots.txt-Generator

Erstelle eine robots.txt: Pfade pro User-Agent erlauben oder sperren, Sitemap und Crawl-delay hinzufügen und KI-Crawler mit einem Klick blockieren.

Läuft lokal, wird nie hochgeladen

Optionen

robots.txt

0 Zeichen · 0 B

Was das Tool macht

Der robots.txt-Generator schreibt die Datei robots.txt, die Crawlern sagt, welche Teile deiner Website sie abrufen dürfen. Wähle die User-Agents der Hauptgruppe, liste die zu sperrenden Pfade und die erlaubten Ausnahmen auf, füge bei Bedarf ein Crawl-delay und eine oder mehrere Sitemap-URLs hinzu – die Datei aktualisiert sich beim Tippen.

Vorlagen decken die üblichen Fälle mit einem Klick ab: Alles erlauben, Alles sperren (praktisch für Staging-Seiten) und ein Ausgangspunkt für WordPress. Eine eigene Einstellung blockiert KI-Crawler entweder nur für das Training oder vollständig, einschließlich KI-Suche und Abrufagenten von Assistenten, und du kannst jeden anderen Bot, etwa SEO-Crawler, per Namen sperren. Pfade, User-Agent-Namen und Sitemap-URLs werden geprüft, sodass ein fehlender führender Schrägstrich oder eine relative Sitemap gemeldet wird, statt stillschweigend eine fehlerhafte Datei zu erzeugen.

So funktioniert es

  1. Beginne mit einer Vorlage oder behalte die Voreinstellung, die alles erlaubt.
  2. Trage unter Gesperrte Pfade Ordner oder Muster ein, die Crawler meiden sollen, kommagetrennt, etwa /admin/, /cart/, /*?sort=. Ausnahmen darin gehören zu Erlaubte Pfade.
  3. Gib deine Sitemap-URL an, damit Suchmaschinen sie auch ohne gesonderte Einreichung finden.
  4. Lege fest, wie mit KI-Crawlern umgegangen wird, und füge weitere zu sperrende Bots hinzu.
  5. Lade die Datei als robots.txt herunter und lege sie ins Wurzelverzeichnis deiner Domain, damit sie unter https://example.com/robots.txt erreichbar ist. Jede Subdomain braucht eine eigene Datei.

Beispiel

/admin/ sperren, /admin/public/ als Ausnahme erlauben, eine Sitemap angeben und KI-Trainings-Crawler blockieren ergibt:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Die KI-Gruppe ist hier gekürzt; das Tool listet alle Crawler.) Mehrere User-agent-Zeilen gefolgt von Regeln bilden eine Gruppe, die für alle gilt, und ein Crawler folgt nur der spezifischsten Gruppe, die ihn nennt.

Tipps

  • * passt auf beliebige Zeichenfolgen und $ verankert das Ende der URL – /*.pdf$ sperrt also alle PDFs.
  • Treffen Allow und Disallow gleichzeitig zu, wendet Google die längste (spezifischste) Regel an.
  • Sperre keine CSS- und JavaScript-Dateien, die Seiten zum Rendern brauchen, sonst bewerten Suchmaschinen sie womöglich falsch.
  • Teste Änderungen mit dem robots.txt-Bericht in der Google Search Console, bevor du dich darauf verlässt.

FAQ

› Entfernt Disallow in der robots.txt eine Seite aus Google?

Nein. Disallow hält gut erzogene Crawler davon ab, eine URL abzurufen, aber die URL kann trotzdem (ohne Snippet) indexiert werden, wenn andere Websites darauf verlinken. Um eine Seite aus den Suchergebnissen herauszuhalten, lass sie crawlen und setze das robots-Meta-Tag noindex oder den Header X-Robots-Tag.

› Welche KI-Crawler blockiert das Tool?

Trainings-Crawler blockieren fügt GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot und weitere Bots hinzu, die Daten für das Modelltraining sammeln. Alle KI-Bots blockieren ergänzt KI-Suchindexer und Abrufagenten von Assistenten wie OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot und Perplexity-User – damit werden deine Seiten unter Umständen nicht mehr in KI-Antworten zitiert.

› Halten sich alle Crawler an die robots.txt?

Seriöse Suchmaschinen und die großen KI-Firmen sagen, dass sie sie beachten, aber robots.txt ist eine Konvention, keine Zugriffskontrolle. Scraper können sie ignorieren – schütze private Inhalte deshalb mit einer Anmeldung und bremse aggressive Bots mit Serverregeln oder einer Firewall.

› Wird Crawl-delay unterstützt?

Bing, Yandex und einige andere Crawler beachten Crawl-delay; Google ignoriert es und passt seine Crawling-Rate automatisch an die Antwortzeit deines Servers an.