DevToolPal
UK

Генератор robots.txt

Створіть файл robots.txt: дозволяйте й забороняйте шляхи для різних user-agent, додайте карту сайту та crawl-delay, заблокуйте ШІ-краулери одним кліком.

Працює локально, нічого не завантажується на сервер

Параметри

robots.txt

0 симв. · 0 B

Що робить інструмент

Генератор robots.txt пише файл robots.txt, який повідомляє краулерам, які частини сайту їм можна завантажувати. Виберіть user-agent для основної групи правил, перелічіть заборонені шляхи й дозволені винятки, за бажання додайте crawl-delay та одну чи кілька URL карти сайту — файл оновлюється під час введення.

Шаблони закривають типові випадки одним кліком: Дозволити все, Заборонити все (зручно для тестових сайтів) та заготовка для WordPress. Окреме налаштування блокує ШІ-краулери або лише для навчання, або повністю, разом із пошуком ШІ та агентами асистентів, а будь-якого іншого бота, наприклад SEO-краулер, можна заблокувати за назвою. Шляхи, назви user-agent і URL карт сайту перевіряються, тож забута початкова скісна риска чи відносна карта сайту дають повідомлення про помилку, а не тихо зламаний файл.

Як користуватися

  1. Почніть із шаблону або залиште типове значення, яке дозволяє все.
  2. У полі Заборонені шляхи перелічіть через кому теки чи шаблони, куди краулерам не можна, наприклад /admin/, /cart/, /*?sort=. Винятки всередині них вкажіть у Дозволених шляхах.
  3. Додайте URL карти сайту, щоб пошуковики знайшли її без окремого надсилання.
  4. Виберіть, що робити з ШІ-краулерами, і додайте інших ботів для блокування.
  5. Завантажте файл як robots.txt і розмістіть у корені домену, щоб він відкривався за адресою https://example.com/robots.txt. Кожному піддомену потрібен свій файл.

Приклад

Заборона /admin/ із винятком для /admin/public/, карта сайту й блокування ШІ-краулерів для навчання дають:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Групу ШІ тут скорочено, інструмент перелічує всіх краулерів.) Кілька рядків User-agent із правилами після них утворюють одну групу, що діє на всіх перелічених, а краулер виконує лише найконкретнішу групу, де його названо.

Поради

  • * збігається з будь-якою послідовністю символів, а $ позначає кінець URL, тож /*.pdf$ блокує всі PDF.
  • Якщо збігаються і Allow, і Disallow, Google застосовує найдовше (найконкретніше) правило.
  • Не забороняйте CSS і JavaScript, потрібні для відображення сторінок, інакше пошуковики можуть хибно їх оцінити.
  • Перевіряйте зміни у звіті robots.txt у Google Search Console, перш ніж на них покладатися.

Часті запитання

› Чи видаляє Disallow у robots.txt сторінку з Google?

Ні. Disallow не дає сумлінним краулерам завантажувати URL, але адреса все одно може потрапити в індекс (без сніпета), якщо на неї посилаються інші сайти. Щоб прибрати сторінку з результатів пошуку, дозвольте її сканування й використайте мета-тег robots зі значенням noindex або заголовок X-Robots-Tag.

› Які ШІ-краулери блокує інструмент?

«Блокувати краулери для навчання» додає GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot та інших ботів, що збирають дані для навчання моделей. «Блокувати всіх ШІ-ботів» додає також пошукові індексатори ШІ та агентів асистентів — OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, — через що ваші сторінки можуть перестати цитуватися у відповідях ШІ.

› Чи всі краулери дотримуються robots.txt?

Поважні пошукові системи та великі ШІ-компанії заявляють, що дотримуються, але robots.txt — це домовленість, а не контроль доступу. Скрапери можуть його ігнорувати, тож закритий вміст захищайте авторизацією, а від агресивних ботів — правилами сервера чи файрволом.

› Чи підтримується Crawl-delay?

Bing, Yandex і деякі інші краулери враховують Crawl-delay; Google його ігнорує й сам підлаштовує частоту сканування під швидкість відповіді сервера.