Cosa fa
Il generatore di robots.txt scrive il file robots.txt che dice ai crawler quali parti del sito possono scaricare. Scegli gli user-agent del gruppo principale, elenca i percorsi da bloccare e le eccezioni consentite, aggiungi se vuoi un crawl-delay e uno o più URL di sitemap: il file si aggiorna mentre scrivi.
Le preimpostazioni coprono i casi comuni con un clic: Consenti tutto, Blocca tutto (utile per i siti di staging) e una base per WordPress. Un’impostazione separata blocca i crawler di IA solo per l’addestramento oppure del tutto, inclusa la ricerca IA e gli agenti degli assistenti, e puoi bloccare per nome qualsiasi altro bot, come i crawler SEO. Percorsi, user-agent e URL delle sitemap vengono controllati, così una barra iniziale dimenticata o una sitemap relativa vengono segnalate invece di produrre in silenzio un file difettoso.
Come si usa
- Parti da una preimpostazione o lascia il valore predefinito, che consente tutto.
- In Percorsi bloccati elenca cartelle o pattern da tenere lontani dai crawler, separati da virgole, come
/admin/, /cart/, /*?sort=. Usa Percorsi consentiti per le eccezioni al loro interno. - Aggiungi l’URL della sitemap, così i motori di ricerca la trovano senza invio separato.
- Scegli come trattare i crawler di IA e aggiungi altri bot da bloccare.
- Scarica il file come
robots.txte caricalo nella radice del dominio, in modo che sia servito suhttps://example.com/robots.txt. Ogni sottodominio ha bisogno del proprio file.
Esempio
Bloccare /admin/ con un’eccezione per /admin/public/, aggiungere una sitemap e bloccare i crawler di addestramento dell’IA produce:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(Qui il gruppo IA è abbreviato; lo strumento elenca tutti i crawler.) Più righe User-agent seguite da regole formano un gruppo valido per tutti, e ogni crawler segue solo il gruppo più specifico che lo nomina.
Suggerimenti
*corrisponde a qualsiasi sequenza di caratteri e$ancora la fine dell’URL, quindi/*.pdf$blocca tutti i PDF.- Se corrispondono sia Allow sia Disallow, Google applica la regola più lunga (più specifica).
- Non bloccare CSS e JavaScript necessari alla visualizzazione delle pagine, o i motori di ricerca potrebbero valutarle male.
- Prova le modifiche con il rapporto robots.txt di Google Search Console prima di farci affidamento.
Domande frequenti
› Disallow nel robots.txt rimuove una pagina da Google?
No. Disallow impedisce ai crawler corretti di scaricare un URL, ma l’URL può comunque essere indicizzato (senza snippet) se altri siti lo collegano. Per escludere una pagina dai risultati, lasciala scansionare e usa il meta tag robots noindex o l’intestazione X-Robots-Tag.
› Quali crawler di IA blocca lo strumento?
Blocca i crawler di addestramento aggiunge GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot e altri bot che raccolgono dati per addestrare modelli. Blocca tutti i bot di IA aggiunge anche gli indicizzatori della ricerca IA e gli agenti degli assistenti, come OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot e Perplexity-User, il che può impedire che le tue pagine vengano citate nelle risposte dell’IA.
› Tutti i crawler rispettano robots.txt?
I motori di ricerca affidabili e le grandi aziende di IA dichiarano di rispettarlo, ma robots.txt è una convenzione, non un controllo di accesso. Gli scraper possono ignorarlo: proteggi i contenuti privati con l’autenticazione e usa regole del server o un firewall contro i bot molesti.
› Crawl-delay è supportato?
Bing, Yandex e alcuni altri crawler rispettano Crawl-delay; Google lo ignora e regola automaticamente la frequenza di scansione in base alla velocità di risposta del server.