O que a ferramenta faz
O gerador de robots.txt escreve o arquivo robots.txt que diz aos rastreadores quais partes do site eles podem baixar. Escolha os user-agents do grupo principal, liste os caminhos a bloquear e as exceções permitidas, adicione se quiser um crawl-delay e uma ou mais URLs de sitemap, e o arquivo é atualizado enquanto você digita.
As predefinições resolvem os casos comuns com um clique: Permitir tudo, Bloquear tudo (útil para ambientes de teste) e um ponto de partida para WordPress. Uma configuração separada bloqueia os rastreadores de IA só para treinamento ou por completo, incluindo busca com IA e agentes de assistentes, e você pode bloquear qualquer outro bot pelo nome, como rastreadores de SEO. Caminhos, user-agents e URLs de sitemap são verificados, então uma barra inicial esquecida ou um sitemap relativo são apontados em vez de gerar um arquivo quebrado sem aviso.
Como usar
- Comece por uma predefinição ou mantenha o padrão, que permite tudo.
- Em Caminhos bloqueados, liste pastas ou padrões que os rastreadores não devem visitar, separados por vírgula, como
/admin/, /cart/, /*?sort=. Use Caminhos permitidos para exceções dentro deles. - Adicione a URL do sitemap para que os buscadores a encontrem sem envio separado.
- Escolha como tratar os rastreadores de IA e adicione outros bots a bloquear.
- Baixe o arquivo como
robots.txte envie-o para a raiz do domínio, para que seja servido emhttps://example.com/robots.txt. Cada subdomínio precisa do próprio arquivo.
Exemplo
Bloquear /admin/ com exceção para /admin/public/, adicionar um sitemap e bloquear os rastreadores de treinamento de IA gera:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(O grupo de IA está resumido aqui; a ferramenta lista todos os rastreadores.) Várias linhas User-agent seguidas de regras formam um grupo que vale para todos eles, e cada rastreador segue apenas o grupo mais específico que o menciona.
Dicas
*corresponde a qualquer sequência de caracteres e$fixa o fim da URL, então/*.pdf$bloqueia todos os PDFs.- Quando Allow e Disallow coincidem, o Google aplica a regra mais longa (mais específica).
- Não bloqueie os CSS e JavaScript de que as páginas precisam para renderizar, ou os buscadores podem avaliá-las mal.
- Teste as mudanças no relatório de robots.txt do Google Search Console antes de confiar nelas.
Perguntas frequentes
› Disallow no robots.txt remove uma página do Google?
Não. Disallow impede que rastreadores bem-comportados baixem uma URL, mas ela ainda pode ser indexada (sem trecho) se outros sites apontarem para ela. Para tirar uma página dos resultados, deixe-a ser rastreada e use a meta tag robots noindex ou o cabeçalho X-Robots-Tag.
› Quais rastreadores de IA a ferramenta bloqueia?
Bloquear rastreadores de treinamento adiciona GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot e outros bots que coletam dados para treinar modelos. Bloquear todos os bots de IA adiciona também indexadores de busca com IA e agentes de assistentes como OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot e Perplexity-User, o que pode impedir que suas páginas sejam citadas em respostas de IA.
› Todos os rastreadores obedecem ao robots.txt?
Buscadores de reputação e as grandes empresas de IA dizem respeitá-lo, mas robots.txt é uma convenção, não um controle de acesso. Scrapers podem ignorá-lo, então proteja conteúdo privado com autenticação e use regras do servidor ou firewall contra bots abusivos.
› O Crawl-delay é suportado?
Bing, Yandex e alguns outros rastreadores respeitam o Crawl-delay; o Google o ignora e ajusta a taxa de rastreamento automaticamente conforme a velocidade de resposta do seu servidor.