DevToolPal
RU

Генератор robots.txt

Создайте файл robots.txt: разрешайте и запрещайте пути для разных user-agent, добавьте карту сайта и crawl-delay, заблокируйте ИИ-краулеры в один клик.

Работает локально, без загрузки на сервер

Параметры

robots.txt

Символов: 0 · 0 B

Что делает инструмент

Генератор robots.txt пишет файл robots.txt, который сообщает краулерам, какие части сайта им можно загружать. Выберите user-agent для основной группы правил, перечислите запрещённые пути и разрешённые исключения, при желании добавьте crawl-delay и один или несколько URL карты сайта — файл обновляется по мере ввода.

Шаблоны закрывают типичные случаи в один клик: Разрешить всё, Запретить всё (удобно для тестовых сайтов) и заготовка для WordPress. Отдельная настройка блокирует ИИ-краулеры либо только для обучения, либо полностью, включая поиск ИИ и агентов ассистентов, а любого другого бота, например SEO-краулер, можно заблокировать по имени. Пути, имена user-agent и URL карт сайта проверяются, поэтому забытая начальная косая черта или относительная карта сайта приводят к сообщению об ошибке, а не к тихо сломанному файлу.

Как пользоваться

  1. Начните с шаблона или оставьте значение по умолчанию, которое разрешает всё.
  2. В поле Запрещённые пути перечислите через запятую папки или шаблоны, куда краулерам нельзя, например /admin/, /cart/, /*?sort=. Исключения внутри них укажите в Разрешённых путях.
  3. Добавьте URL карты сайта, чтобы поисковики нашли её без отдельной отправки.
  4. Выберите, что делать с ИИ-краулерами, и добавьте других ботов для блокировки.
  5. Скачайте файл как robots.txt и загрузите в корень домена, чтобы он открывался по адресу https://example.com/robots.txt. Каждому поддомену нужен свой файл.

Пример

Запрет /admin/ с исключением для /admin/public/, карта сайта и блокировка ИИ-краулеров для обучения дают:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Группа ИИ здесь сокращена, инструмент перечисляет всех краулеров.) Несколько строк User-agent с правилами после них образуют одну группу, действующую на всех перечисленных, а краулер следует только самой конкретной группе, где он назван.

Советы

  • * совпадает с любой последовательностью символов, а $ обозначает конец URL, поэтому /*.pdf$ блокирует все PDF.
  • Если совпадают и Allow, и Disallow, Google применяет самое длинное (конкретное) правило.
  • Не запрещайте CSS и JavaScript, нужные для отрисовки страниц, иначе поисковики могут неверно их оценить.
  • Проверяйте изменения в отчёте robots.txt в Google Search Console, прежде чем на них полагаться.

Частые вопросы

› Удаляет ли Disallow в robots.txt страницу из Google?

Нет. Disallow не даёт добросовестным краулерам загружать URL, но адрес всё равно может попасть в индекс (без сниппета), если на него ссылаются другие сайты. Чтобы убрать страницу из результатов поиска, разрешите её сканирование и используйте мета-тег robots со значением noindex или заголовок X-Robots-Tag.

› Какие ИИ-краулеры блокирует инструмент?

«Блокировать краулеры для обучения» добавляет GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot и других ботов, собирающих данные для обучения моделей. «Блокировать всех ИИ-ботов» добавляет также поисковые индексаторы ИИ и агентов ассистентов — OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, — из-за чего ваши страницы могут перестать цитироваться в ответах ИИ.

› Все ли краулеры соблюдают robots.txt?

Солидные поисковые системы и крупные ИИ-компании заявляют, что соблюдают, но robots.txt — это соглашение, а не контроль доступа. Скраперы могут его игнорировать, поэтому закрытый контент защищайте авторизацией, а от агрессивных ботов — правилами сервера или файрволом.

› Поддерживается ли Crawl-delay?

Bing, Яндекс и некоторые другие краулеры учитывают Crawl-delay; Google его игнорирует и сам подстраивает частоту сканирования под скорость ответа сервера.