이 도구가 하는 일
robots.txt 생성기는 크롤러가 사이트의 어느 부분을 가져가도 되는지 알려 주는 robots.txt 파일을 만듭니다. 기본 규칙 그룹의 User-agent를 고르고, 차단할 경로와 그 안의 허용 예외를 나열하고, 필요하면 크롤링 지연과 사이트맵 URL(여러 개 가능)을 추가하면 입력에 따라 파일이 바로 갱신됩니다.
프리셋으로 흔한 경우를 한 번에 설정할 수 있습니다. 모두 허용, 모두 차단(스테이징 사이트에 유용), 그리고 WordPress 시작 설정입니다. 별도 설정으로 AI 크롤러를 모델 학습용만 차단하거나 AI 검색 및 어시스턴트 가져오기 에이전트까지 모두 차단할 수 있고, SEO 크롤러 같은 다른 봇도 이름으로 차단할 수 있습니다. 경로, User-agent 이름, 사이트맵 URL을 검사하므로 앞의 슬래시를 빠뜨리거나 상대 경로 사이트맵을 넣으면 망가진 파일을 조용히 만드는 대신 오류로 알려 줍니다.
사용 방법
- 프리셋에서 시작하거나 모두 허용인 기본값을 유지합니다.
- 차단할 경로에 크롤러가 들어가지 않을 폴더나 패턴을 쉼표로 구분해 입력합니다(예:
/admin/, /cart/, /*?sort=). 그 안의 예외는 허용할 경로에 넣습니다. - 사이트맵 URL을 추가하면 검색 엔진이 따로 제출하지 않아도 찾을 수 있습니다.
- AI 크롤러 처리 방식을 고르고 차단할 다른 봇을 추가합니다.
robots.txt로 다운로드해https://example.com/robots.txt에서 제공되도록 도메인 루트에 업로드합니다. 하위 도메인마다 별도의 파일이 필요합니다.
예시
/admin/을 차단하고 /admin/public/을 예외로 허용하며 사이트맵을 추가하고 AI 학습용 크롤러를 차단하면 다음과 같습니다.
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(여기서는 AI 그룹을 줄였으며 도구는 모든 크롤러를 나열합니다.) 여러 User-agent 줄과 뒤따르는 규칙이 하나의 그룹이 되어 모두에게 적용되며, 크롤러는 자신을 지목한 가장 구체적인 그룹만 따릅니다.
팁
*는 임의의 문자열과,$는 URL의 끝과 일치하므로/*.pdf$는 모든 PDF를 차단합니다.- Allow와 Disallow가 모두 일치하면 Google은 가장 긴(구체적인) 규칙을 적용합니다.
- 페이지 렌더링에 필요한 CSS와 JavaScript 파일은 차단하지 마세요. 검색 엔진이 페이지를 잘못 평가할 수 있습니다.
- 변경 사항을 적용하기 전에 Google Search Console의 robots.txt 보고서로 테스트하세요.
자주 묻는 질문
› robots.txt의 Disallow로 Google에서 페이지를 삭제할 수 있나요?
아니요. Disallow는 규칙을 지키는 크롤러가 URL을 가져가지 못하게 할 뿐, 다른 사이트가 링크하면 URL은 (스니펫 없이) 색인될 수 있습니다. 검색 결과에서 빼려면 크롤링을 허용하고 noindex robots 메타 태그나 X-Robots-Tag 헤더를 사용하세요.
› 어떤 AI 크롤러를 차단하나요?
학습용 크롤러 차단은 GPTBot, ClaudeBot, anthropic-ai, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot 등 모델 학습용 데이터를 수집하는 봇을 추가합니다. 모든 AI 봇 차단은 OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User 같은 AI 검색 색인기와 어시스턴트 가져오기 에이전트도 추가하므로, AI 답변에서 페이지가 인용되지 않을 수 있습니다.
› 모든 크롤러가 robots.txt를 따르나요?
신뢰할 수 있는 검색 엔진과 주요 AI 기업은 따른다고 밝히지만, robots.txt는 관례일 뿐 접근 제어가 아닙니다. 스크레이퍼는 무시할 수 있으므로 비공개 콘텐츠는 인증으로 보호하고, 악성 봇은 서버 규칙이나 방화벽으로 막으세요.
› Crawl-delay를 지원하나요?
Bing, Yandex 등 일부 크롤러는 Crawl-delay를 따르지만, Google은 무시하고 서버 응답 속도에 맞춰 크롤링 속도를 자동으로 조절합니다.