DevToolPal
FR

Générateur de robots.txt

Créez un fichier robots.txt : autorisez ou bloquez des chemins par user-agent, ajoutez votre sitemap et un crawl-delay, et bloquez les robots d’IA en un clic.

Traitement local, rien n'est envoyé

Options

robots.txt

0 caractères · 0 B

Ce que fait l’outil

Le générateur de robots.txt écrit le fichier robots.txt qui indique aux robots les parties de votre site qu’ils peuvent télécharger. Choisissez les user-agents du groupe principal, listez les chemins à interdire et les exceptions autorisées, ajoutez si besoin un crawl-delay et une ou plusieurs URL de sitemap : le fichier se met à jour au fil de la saisie.

Les préréglages couvrent les cas courants en un clic : Tout autoriser, Tout bloquer (pratique pour un site de préproduction) et une base pour WordPress. Un réglage distinct bloque les robots d’IA soit pour l’entraînement uniquement, soit entièrement, y compris la recherche IA et les agents des assistants, et vous pouvez bloquer par son nom n’importe quel autre robot, comme les robots SEO. Les chemins, les user-agents et les URL de sitemap sont vérifiés : une barre oblique initiale oubliée ou un sitemap relatif est signalé au lieu de produire en silence un fichier défectueux.

Mode d’emploi

  1. Partez d’un préréglage ou gardez la valeur par défaut, qui autorise tout.
  2. Dans Chemins interdits, listez les dossiers ou motifs à tenir à l’écart des robots, séparés par des virgules, par exemple /admin/, /cart/, /*?sort=. Utilisez Chemins autorisés pour les exceptions à l’intérieur.
  3. Ajoutez l’URL de votre sitemap pour que les moteurs la trouvent sans soumission séparée.
  4. Choisissez le traitement des robots d’IA et ajoutez d’autres robots à bloquer.
  5. Téléchargez le fichier sous le nom robots.txt et placez-le à la racine du domaine, pour qu’il soit servi à https://example.com/robots.txt. Chaque sous-domaine a besoin de son propre fichier.

Exemple

Interdire /admin/ avec une exception pour /admin/public/, ajouter un sitemap et bloquer les robots d’entraînement d’IA donne :

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Le groupe IA est abrégé ici ; l’outil liste tous les robots.) Plusieurs lignes User-agent suivies de règles forment un groupe qui s’applique à chacun d’eux, et un robot ne suit que le groupe le plus spécifique qui le nomme.

Conseils

  • * correspond à n’importe quelle suite de caractères et $ ancre la fin de l’URL : /*.pdf$ bloque donc tous les PDF.
  • Quand Allow et Disallow correspondent tous deux, Google applique la règle la plus longue (la plus spécifique).
  • Ne bloquez pas les CSS et JavaScript nécessaires à l’affichage des pages, sinon les moteurs risquent de mal les évaluer.
  • Testez vos modifications avec le rapport robots.txt de Google Search Console avant de vous y fier.

FAQ

› Disallow dans robots.txt retire-t-il une page de Google ?

Non. Disallow empêche les robots respectueux de télécharger une URL, mais celle-ci peut quand même être indexée (sans extrait) si d’autres sites y renvoient. Pour exclure une page des résultats, laissez-la explorer et utilisez la balise meta robots noindex ou l’en-tête X-Robots-Tag.

› Quels robots d’IA l’outil bloque-t-il ?

Bloquer les robots d’entraînement ajoute GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot et d’autres robots qui collectent des données pour entraîner des modèles. Bloquer tous les robots d’IA ajoute aussi les indexeurs de recherche IA et les agents des assistants, comme OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot et Perplexity-User, ce qui peut empêcher vos pages d’être citées dans des réponses d’IA.

› Tous les robots respectent-ils robots.txt ?

Les moteurs de recherche sérieux et les grandes entreprises d’IA disent le respecter, mais robots.txt est une convention, pas un contrôle d’accès. Les scrapers peuvent l’ignorer : protégez le contenu privé par une authentification et utilisez des règles serveur ou un pare-feu contre les robots abusifs.

› Crawl-delay est-il pris en charge ?

Bing, Yandex et quelques autres robots respectent Crawl-delay ; Google l’ignore et ajuste automatiquement sa fréquence d’exploration selon la rapidité de réponse de votre serveur.