DevToolPal
PL

Generator robots.txt

Utwórz plik robots.txt: zezwalaj na ścieżki lub je blokuj dla poszczególnych user-agentów, dodaj mapę witryny i crawl-delay, zablokuj roboty AI jednym kliknięciem.

Działa lokalnie, nic nie jest wysyłane

Opcje

robots.txt

0 znaków · 0 B

Co robi to narzędzie

Generator robots.txt tworzy plik robots.txt, który mówi robotom, które części witryny mogą pobierać. Wybierz user-agenty głównej grupy, wypisz ścieżki do zablokowania i dozwolone wyjątki, opcjonalnie dodaj crawl-delay oraz jeden lub więcej adresów map witryny, a plik aktualizuje się podczas pisania.

Gotowe ustawienia jednym kliknięciem obsługują typowe przypadki: Zezwól na wszystko, Zablokuj wszystko (przydatne dla wersji testowych) oraz punkt wyjścia dla WordPressa. Osobne ustawienie blokuje roboty AI tylko do trenowania albo całkowicie, łącznie z wyszukiwaniem AI i agentami asystentów, a dowolnego innego bota, np. robota SEO, możesz zablokować po nazwie. Ścieżki, nazwy user-agentów i adresy map witryny są sprawdzane, więc brakujący ukośnik na początku lub względna mapa witryny zostaną zgłoszone, zamiast po cichu wygenerować wadliwy plik.

Jak używać

  1. Zacznij od gotowego ustawienia lub zostaw domyślne, które zezwala na wszystko.
  2. W polu Zablokowane ścieżki wpisz foldery lub wzorce, do których roboty nie mają wchodzić, oddzielone przecinkami, np. /admin/, /cart/, /*?sort=. Wyjątki w nich podaj w Dozwolonych ścieżkach.
  3. Dodaj adres mapy witryny, aby wyszukiwarki znalazły ją bez osobnego zgłaszania.
  4. Wybierz, co zrobić z robotami AI, i dodaj inne boty do zablokowania.
  5. Pobierz plik jako robots.txt i umieść go w katalogu głównym domeny, aby był dostępny pod https://example.com/robots.txt. Każda subdomena potrzebuje własnego pliku.

Przykład

Zablokowanie /admin/ z wyjątkiem dla /admin/public/, dodanie mapy witryny i zablokowanie robotów treningowych AI daje:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(Grupa AI jest tu skrócona; narzędzie wypisuje wszystkie roboty.) Kilka wierszy User-agent, po których następują reguły, tworzy jedną grupę obowiązującą wszystkich wymienionych, a robot stosuje tylko najbardziej szczegółową grupę, w której jest wymieniony.

Wskazówki

  • * pasuje do dowolnego ciągu znaków, a $ oznacza koniec adresu URL, więc /*.pdf$ blokuje wszystkie pliki PDF.
  • Gdy pasują zarówno Allow, jak i Disallow, Google stosuje najdłuższą (najbardziej szczegółową) regułę.
  • Nie blokuj plików CSS i JavaScript potrzebnych do wyświetlenia stron, bo wyszukiwarki mogą je źle ocenić.
  • Przetestuj zmiany w raporcie robots.txt w Google Search Console, zanim na nich polegasz.

FAQ

› Czy Disallow w robots.txt usuwa stronę z Google?

Nie. Disallow powstrzymuje dobrze wychowane roboty przed pobraniem adresu URL, ale adres może i tak zostać zaindeksowany (bez fragmentu), jeśli linkują do niego inne witryny. Aby usunąć stronę z wyników, pozwól ją skanować i użyj meta tagu robots noindex lub nagłówka X-Robots-Tag.

› Które roboty AI blokuje narzędzie?

Zablokuj roboty treningowe dodaje GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot i inne boty zbierające dane do trenowania modeli. Zablokuj wszystkie boty AI dodaje również indeksery wyszukiwania AI i agentów asystentów, takich jak OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot i Perplexity-User, co może sprawić, że twoje strony przestaną być cytowane w odpowiedziach AI.

› Czy wszystkie roboty przestrzegają robots.txt?

Renomowane wyszukiwarki i duże firmy AI deklarują, że tak, ale robots.txt to konwencja, a nie kontrola dostępu. Scrapery mogą go ignorować, więc prywatne treści chroń logowaniem, a uciążliwe boty blokuj regułami serwera lub zaporą.

› Czy Crawl-delay jest obsługiwany?

Bing, Yandex i niektóre inne roboty respektują Crawl-delay; Google go ignoruje i sam dostosowuje tempo skanowania do szybkości odpowiedzi serwera.