Co robi to narzędzie
Generator robots.txt tworzy plik robots.txt, który mówi robotom, które części witryny mogą pobierać. Wybierz user-agenty głównej grupy, wypisz ścieżki do zablokowania i dozwolone wyjątki, opcjonalnie dodaj crawl-delay oraz jeden lub więcej adresów map witryny, a plik aktualizuje się podczas pisania.
Gotowe ustawienia jednym kliknięciem obsługują typowe przypadki: Zezwól na wszystko, Zablokuj wszystko (przydatne dla wersji testowych) oraz punkt wyjścia dla WordPressa. Osobne ustawienie blokuje roboty AI tylko do trenowania albo całkowicie, łącznie z wyszukiwaniem AI i agentami asystentów, a dowolnego innego bota, np. robota SEO, możesz zablokować po nazwie. Ścieżki, nazwy user-agentów i adresy map witryny są sprawdzane, więc brakujący ukośnik na początku lub względna mapa witryny zostaną zgłoszone, zamiast po cichu wygenerować wadliwy plik.
Jak używać
- Zacznij od gotowego ustawienia lub zostaw domyślne, które zezwala na wszystko.
- W polu Zablokowane ścieżki wpisz foldery lub wzorce, do których roboty nie mają wchodzić, oddzielone przecinkami, np.
/admin/, /cart/, /*?sort=. Wyjątki w nich podaj w Dozwolonych ścieżkach. - Dodaj adres mapy witryny, aby wyszukiwarki znalazły ją bez osobnego zgłaszania.
- Wybierz, co zrobić z robotami AI, i dodaj inne boty do zablokowania.
- Pobierz plik jako
robots.txti umieść go w katalogu głównym domeny, aby był dostępny podhttps://example.com/robots.txt. Każda subdomena potrzebuje własnego pliku.
Przykład
Zablokowanie /admin/ z wyjątkiem dla /admin/public/, dodanie mapy witryny i zablokowanie robotów treningowych AI daje:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(Grupa AI jest tu skrócona; narzędzie wypisuje wszystkie roboty.) Kilka wierszy User-agent, po których następują reguły, tworzy jedną grupę obowiązującą wszystkich wymienionych, a robot stosuje tylko najbardziej szczegółową grupę, w której jest wymieniony.
Wskazówki
*pasuje do dowolnego ciągu znaków, a$oznacza koniec adresu URL, więc/*.pdf$blokuje wszystkie pliki PDF.- Gdy pasują zarówno Allow, jak i Disallow, Google stosuje najdłuższą (najbardziej szczegółową) regułę.
- Nie blokuj plików CSS i JavaScript potrzebnych do wyświetlenia stron, bo wyszukiwarki mogą je źle ocenić.
- Przetestuj zmiany w raporcie robots.txt w Google Search Console, zanim na nich polegasz.
FAQ
› Czy Disallow w robots.txt usuwa stronę z Google?
Nie. Disallow powstrzymuje dobrze wychowane roboty przed pobraniem adresu URL, ale adres może i tak zostać zaindeksowany (bez fragmentu), jeśli linkują do niego inne witryny. Aby usunąć stronę z wyników, pozwól ją skanować i użyj meta tagu robots noindex lub nagłówka X-Robots-Tag.
› Które roboty AI blokuje narzędzie?
Zablokuj roboty treningowe dodaje GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot i inne boty zbierające dane do trenowania modeli. Zablokuj wszystkie boty AI dodaje również indeksery wyszukiwania AI i agentów asystentów, takich jak OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot i Perplexity-User, co może sprawić, że twoje strony przestaną być cytowane w odpowiedziach AI.
› Czy wszystkie roboty przestrzegają robots.txt?
Renomowane wyszukiwarki i duże firmy AI deklarują, że tak, ale robots.txt to konwencja, a nie kontrola dostępu. Scrapery mogą go ignorować, więc prywatne treści chroń logowaniem, a uciążliwe boty blokuj regułami serwera lub zaporą.
› Czy Crawl-delay jest obsługiwany?
Bing, Yandex i niektóre inne roboty respektują Crawl-delay; Google go ignoruje i sam dostosowuje tempo skanowania do szybkości odpowiedzi serwera.