Що робить інструмент
Генератор robots.txt пише файл robots.txt, який повідомляє краулерам, які частини сайту їм можна завантажувати. Виберіть user-agent для основної групи правил, перелічіть заборонені шляхи й дозволені винятки, за бажання додайте crawl-delay та одну чи кілька URL карти сайту — файл оновлюється під час введення.
Шаблони закривають типові випадки одним кліком: Дозволити все, Заборонити все (зручно для тестових сайтів) та заготовка для WordPress. Окреме налаштування блокує ШІ-краулери або лише для навчання, або повністю, разом із пошуком ШІ та агентами асистентів, а будь-якого іншого бота, наприклад SEO-краулер, можна заблокувати за назвою. Шляхи, назви user-agent і URL карт сайту перевіряються, тож забута початкова скісна риска чи відносна карта сайту дають повідомлення про помилку, а не тихо зламаний файл.
Як користуватися
- Почніть із шаблону або залиште типове значення, яке дозволяє все.
- У полі Заборонені шляхи перелічіть через кому теки чи шаблони, куди краулерам не можна, наприклад
/admin/, /cart/, /*?sort=. Винятки всередині них вкажіть у Дозволених шляхах. - Додайте URL карти сайту, щоб пошуковики знайшли її без окремого надсилання.
- Виберіть, що робити з ШІ-краулерами, і додайте інших ботів для блокування.
- Завантажте файл як
robots.txtі розмістіть у корені домену, щоб він відкривався за адресоюhttps://example.com/robots.txt. Кожному піддомену потрібен свій файл.
Приклад
Заборона /admin/ із винятком для /admin/public/, карта сайту й блокування ШІ-краулерів для навчання дають:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(Групу ШІ тут скорочено, інструмент перелічує всіх краулерів.) Кілька рядків User-agent із правилами після них утворюють одну групу, що діє на всіх перелічених, а краулер виконує лише найконкретнішу групу, де його названо.
Поради
*збігається з будь-якою послідовністю символів, а$позначає кінець URL, тож/*.pdf$блокує всі PDF.- Якщо збігаються і Allow, і Disallow, Google застосовує найдовше (найконкретніше) правило.
- Не забороняйте CSS і JavaScript, потрібні для відображення сторінок, інакше пошуковики можуть хибно їх оцінити.
- Перевіряйте зміни у звіті robots.txt у Google Search Console, перш ніж на них покладатися.
Часті запитання
› Чи видаляє Disallow у robots.txt сторінку з Google?
Ні. Disallow не дає сумлінним краулерам завантажувати URL, але адреса все одно може потрапити в індекс (без сніпета), якщо на неї посилаються інші сайти. Щоб прибрати сторінку з результатів пошуку, дозвольте її сканування й використайте мета-тег robots зі значенням noindex або заголовок X-Robots-Tag.
› Які ШІ-краулери блокує інструмент?
«Блокувати краулери для навчання» додає GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot та інших ботів, що збирають дані для навчання моделей. «Блокувати всіх ШІ-ботів» додає також пошукові індексатори ШІ та агентів асистентів — OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, — через що ваші сторінки можуть перестати цитуватися у відповідях ШІ.
› Чи всі краулери дотримуються robots.txt?
Поважні пошукові системи та великі ШІ-компанії заявляють, що дотримуються, але robots.txt — це домовленість, а не контроль доступу. Скрапери можуть його ігнорувати, тож закритий вміст захищайте авторизацією, а від агресивних ботів — правилами сервера чи файрволом.
› Чи підтримується Crawl-delay?
Bing, Yandex і деякі інші краулери враховують Crawl-delay; Google його ігнорує й сам підлаштовує частоту сканування під швидкість відповіді сервера.