DevToolPal
ES

Generador de robots.txt

Crea un archivo robots.txt: permite o bloquea rutas por user-agent, añade tu sitemap y crawl-delay y bloquea los rastreadores de IA con un clic.

Se ejecuta en local, nunca se sube

Opciones

robots.txt

0 caracteres · 0 B

Qué hace

El generador de robots.txt escribe el archivo robots.txt que indica a los rastreadores qué partes de tu sitio pueden descargar. Elige los user-agents del grupo principal, enumera las rutas que quieres bloquear y las excepciones permitidas, añade si quieres un crawl-delay y una o más URL de sitemap, y el archivo se actualiza mientras escribes.

Los ajustes rápidos cubren los casos habituales con un clic: Permitir todo, Bloquear todo (útil para sitios de pruebas) y un punto de partida para WordPress. Otro ajuste bloquea los rastreadores de IA solo para entrenamiento o por completo, incluidos los de búsqueda con IA y los agentes de asistentes, y puedes bloquear por nombre cualquier otro bot, como los rastreadores SEO. Se comprueban las rutas, los user-agents y las URL de sitemap, de modo que una barra inicial olvidada o un sitemap relativo se notifican en lugar de generar un archivo roto sin avisar.

Cómo usarlo

  1. Empieza con un ajuste rápido o deja el valor por defecto, que lo permite todo.
  2. En Rutas bloqueadas, escribe las carpetas o patrones que los rastreadores no deben visitar, separados por comas, como /admin/, /cart/, /*?sort=. Usa Rutas permitidas para las excepciones dentro de ellas.
  3. Añade la URL de tu sitemap para que los buscadores la encuentren sin enviarla aparte.
  4. Elige qué hacer con los rastreadores de IA y añade otros bots que quieras bloquear.
  5. Descarga el archivo como robots.txt y súbelo a la raíz de tu dominio para que se sirva en https://example.com/robots.txt. Cada subdominio necesita su propio archivo.

Ejemplo

Bloquear /admin/ con una excepción para /admin/public/, añadir un sitemap y bloquear los rastreadores de entrenamiento de IA produce:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Aquí el grupo de IA está abreviado; la herramienta enumera todos los rastreadores.) Varias líneas User-agent seguidas de reglas forman un grupo que se aplica a todos ellos, y cada rastreador sigue solo el grupo más específico que lo nombra.

Consejos

  • * coincide con cualquier secuencia de caracteres y $ fija el final de la URL, así que /*.pdf$ bloquea todos los PDF.
  • Si coinciden Allow y Disallow, Google aplica la regla más larga (la más específica).
  • No bloquees los CSS y JavaScript que las páginas necesitan para mostrarse, o los buscadores podrían valorarlas mal.
  • Prueba los cambios con el informe de robots.txt de Google Search Console antes de confiar en ellos.

Preguntas frecuentes

› ¿Disallow en robots.txt elimina una página de Google?

No. Disallow impide que los rastreadores respetuosos descarguen una URL, pero esa URL aún puede indexarse (sin fragmento) si otros sitios la enlazan. Para que una página no salga en los resultados, deja que se rastree y usa la metaetiqueta robots noindex o la cabecera X-Robots-Tag.

› ¿Qué rastreadores de IA bloquea la herramienta?

Bloquear rastreadores de entrenamiento añade GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot y otros bots que recopilan datos para entrenar modelos. Bloquear todos los bots de IA añade además indexadores de búsqueda con IA y agentes de asistentes como OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot y Perplexity-User, lo que puede impedir que tus páginas se citen en respuestas de IA.

› ¿Todos los rastreadores obedecen robots.txt?

Los buscadores serios y las grandes empresas de IA dicen respetarlo, pero robots.txt es una convención, no un control de acceso. Los scrapers pueden ignorarlo, así que protege el contenido privado con autenticación y usa reglas del servidor o un firewall contra bots abusivos.

› ¿Se admite Crawl-delay?

Bing, Yandex y algunos otros rastreadores respetan Crawl-delay; Google lo ignora y ajusta su frecuencia de rastreo automáticamente según la rapidez con que responde tu servidor.