DevToolPal
PT

Gerador de robots.txt

Crie um arquivo robots.txt: permita ou bloqueie caminhos por user-agent, adicione o sitemap e o crawl-delay e bloqueie rastreadores de IA com um clique.

Roda localmente, nada é enviado

Opções

robots.txt

0 caracteres · 0 B

O que a ferramenta faz

O gerador de robots.txt escreve o arquivo robots.txt que diz aos rastreadores quais partes do site eles podem baixar. Escolha os user-agents do grupo principal, liste os caminhos a bloquear e as exceções permitidas, adicione se quiser um crawl-delay e uma ou mais URLs de sitemap, e o arquivo é atualizado enquanto você digita.

As predefinições resolvem os casos comuns com um clique: Permitir tudo, Bloquear tudo (útil para ambientes de teste) e um ponto de partida para WordPress. Uma configuração separada bloqueia os rastreadores de IA só para treinamento ou por completo, incluindo busca com IA e agentes de assistentes, e você pode bloquear qualquer outro bot pelo nome, como rastreadores de SEO. Caminhos, user-agents e URLs de sitemap são verificados, então uma barra inicial esquecida ou um sitemap relativo são apontados em vez de gerar um arquivo quebrado sem aviso.

Como usar

  1. Comece por uma predefinição ou mantenha o padrão, que permite tudo.
  2. Em Caminhos bloqueados, liste pastas ou padrões que os rastreadores não devem visitar, separados por vírgula, como /admin/, /cart/, /*?sort=. Use Caminhos permitidos para exceções dentro deles.
  3. Adicione a URL do sitemap para que os buscadores a encontrem sem envio separado.
  4. Escolha como tratar os rastreadores de IA e adicione outros bots a bloquear.
  5. Baixe o arquivo como robots.txt e envie-o para a raiz do domínio, para que seja servido em https://example.com/robots.txt. Cada subdomínio precisa do próprio arquivo.

Exemplo

Bloquear /admin/ com exceção para /admin/public/, adicionar um sitemap e bloquear os rastreadores de treinamento de IA gera:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(O grupo de IA está resumido aqui; a ferramenta lista todos os rastreadores.) Várias linhas User-agent seguidas de regras formam um grupo que vale para todos eles, e cada rastreador segue apenas o grupo mais específico que o menciona.

Dicas

  • * corresponde a qualquer sequência de caracteres e $ fixa o fim da URL, então /*.pdf$ bloqueia todos os PDFs.
  • Quando Allow e Disallow coincidem, o Google aplica a regra mais longa (mais específica).
  • Não bloqueie os CSS e JavaScript de que as páginas precisam para renderizar, ou os buscadores podem avaliá-las mal.
  • Teste as mudanças no relatório de robots.txt do Google Search Console antes de confiar nelas.

Perguntas frequentes

› Disallow no robots.txt remove uma página do Google?

Não. Disallow impede que rastreadores bem-comportados baixem uma URL, mas ela ainda pode ser indexada (sem trecho) se outros sites apontarem para ela. Para tirar uma página dos resultados, deixe-a ser rastreada e use a meta tag robots noindex ou o cabeçalho X-Robots-Tag.

› Quais rastreadores de IA a ferramenta bloqueia?

Bloquear rastreadores de treinamento adiciona GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot e outros bots que coletam dados para treinar modelos. Bloquear todos os bots de IA adiciona também indexadores de busca com IA e agentes de assistentes como OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot e Perplexity-User, o que pode impedir que suas páginas sejam citadas em respostas de IA.

› Todos os rastreadores obedecem ao robots.txt?

Buscadores de reputação e as grandes empresas de IA dizem respeitá-lo, mas robots.txt é uma convenção, não um controle de acesso. Scrapers podem ignorá-lo, então proteja conteúdo privado com autenticação e use regras do servidor ou firewall contra bots abusivos.

› O Crawl-delay é suportado?

Bing, Yandex e alguns outros rastreadores respeitam o Crawl-delay; o Google o ignora e ajusta a taxa de rastreamento automaticamente conforme a velocidade de resposta do seu servidor.