Что делает инструмент
Генератор robots.txt пишет файл robots.txt, который сообщает краулерам, какие части сайта им можно загружать. Выберите user-agent для основной группы правил, перечислите запрещённые пути и разрешённые исключения, при желании добавьте crawl-delay и один или несколько URL карты сайта — файл обновляется по мере ввода.
Шаблоны закрывают типичные случаи в один клик: Разрешить всё, Запретить всё (удобно для тестовых сайтов) и заготовка для WordPress. Отдельная настройка блокирует ИИ-краулеры либо только для обучения, либо полностью, включая поиск ИИ и агентов ассистентов, а любого другого бота, например SEO-краулер, можно заблокировать по имени. Пути, имена user-agent и URL карт сайта проверяются, поэтому забытая начальная косая черта или относительная карта сайта приводят к сообщению об ошибке, а не к тихо сломанному файлу.
Как пользоваться
- Начните с шаблона или оставьте значение по умолчанию, которое разрешает всё.
- В поле Запрещённые пути перечислите через запятую папки или шаблоны, куда краулерам нельзя, например
/admin/, /cart/, /*?sort=. Исключения внутри них укажите в Разрешённых путях. - Добавьте URL карты сайта, чтобы поисковики нашли её без отдельной отправки.
- Выберите, что делать с ИИ-краулерами, и добавьте других ботов для блокировки.
- Скачайте файл как
robots.txtи загрузите в корень домена, чтобы он открывался по адресуhttps://example.com/robots.txt. Каждому поддомену нужен свой файл.
Пример
Запрет /admin/ с исключением для /admin/public/, карта сайта и блокировка ИИ-краулеров для обучения дают:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(Группа ИИ здесь сокращена, инструмент перечисляет всех краулеров.) Несколько строк User-agent с правилами после них образуют одну группу, действующую на всех перечисленных, а краулер следует только самой конкретной группе, где он назван.
Советы
*совпадает с любой последовательностью символов, а$обозначает конец URL, поэтому/*.pdf$блокирует все PDF.- Если совпадают и Allow, и Disallow, Google применяет самое длинное (конкретное) правило.
- Не запрещайте CSS и JavaScript, нужные для отрисовки страниц, иначе поисковики могут неверно их оценить.
- Проверяйте изменения в отчёте robots.txt в Google Search Console, прежде чем на них полагаться.
Частые вопросы
› Удаляет ли Disallow в robots.txt страницу из Google?
Нет. Disallow не даёт добросовестным краулерам загружать URL, но адрес всё равно может попасть в индекс (без сниппета), если на него ссылаются другие сайты. Чтобы убрать страницу из результатов поиска, разрешите её сканирование и используйте мета-тег robots со значением noindex или заголовок X-Robots-Tag.
› Какие ИИ-краулеры блокирует инструмент?
«Блокировать краулеры для обучения» добавляет GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot и других ботов, собирающих данные для обучения моделей. «Блокировать всех ИИ-ботов» добавляет также поисковые индексаторы ИИ и агентов ассистентов — OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, — из-за чего ваши страницы могут перестать цитироваться в ответах ИИ.
› Все ли краулеры соблюдают robots.txt?
Солидные поисковые системы и крупные ИИ-компании заявляют, что соблюдают, но robots.txt — это соглашение, а не контроль доступа. Скраперы могут его игнорировать, поэтому закрытый контент защищайте авторизацией, а от агрессивных ботов — правилами сервера или файрволом.
› Поддерживается ли Crawl-delay?
Bing, Яндекс и некоторые другие краулеры учитывают Crawl-delay; Google его игнорирует и сам подстраивает частоту сканирования под скорость ответа сервера.