このツールについて
robots.txt ジェネレーターは、クローラーがサイトのどの部分を取得してよいかを伝える robots.txt ファイルを作成します。メインのルールグループの User-agent を選び、拒否するパスとその中で許可する例外を並べ、必要ならクロール間隔とサイトマップ URL(複数可)を追加すると、入力に合わせてファイルが更新されます。
プリセットでよくあるケースをワンクリックで設定できます。すべて許可、すべて拒否(ステージング環境向け)、そして WordPress 用の初期設定です。別の設定では、AI クローラーをモデル学習用だけブロックするか、AI 検索やアシスタントの取得エージェントも含めてすべてブロックするかを選べ、SEO クローラーなど任意のボットを名前でブロックすることもできます。パス、User-agent 名、サイトマップ URL はチェックされるので、先頭のスラッシュ忘れや相対形式のサイトマップは、壊れたファイルを黙って作る代わりにエラーとして表示されます。
使い方
- プリセットから始めるか、すべて許可のデフォルトのままにします。
- 拒否するパスに、クローラーを入れたくないフォルダーやパターンをカンマ区切りで入力します(例:
/admin/, /cart/, /*?sort=)。その中の例外は許可するパスに入れます。 - サイトマップ URL を追加すると、検索エンジンは別途登録しなくても見つけられます。
- AI クローラーの扱いを選び、ほかにブロックしたいボットを追加します。
robots.txtとしてダウンロードし、https://example.com/robots.txtで配信されるようドメインのルートにアップロードします。サブドメインごとに個別のファイルが必要です。
例
/admin/ を拒否して /admin/public/ を例外として許可し、サイトマップを追加して AI の学習用クローラーをブロックすると、次のようになります。
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(AI のグループは一部省略しています。ツールではすべてのクローラーを列挙します。)複数の User-agent 行とそれに続くルールが 1 つのグループとなり、その全員に適用されます。クローラーは自分を名指しした最も具体的なグループだけに従います。
ヒント
*は任意の文字列に一致し、$は URL の末尾を表すので、/*.pdf$ですべての PDF をブロックできます。- Allow と Disallow の両方に一致した場合、Google は最も長い(具体的な)ルールを適用します。
- ページの表示に必要な CSS や JavaScript はブロックしないでください。検索エンジンがページを誤って評価するおそれがあります。
- 変更に頼る前に、Google Search Console の robots.txt レポートでテストしましょう。
よくある質問
› robots.txt の Disallow でページを Google から削除できますか?
できません。Disallow は行儀のよいクローラーに URL を取得させないだけで、他サイトからリンクされていれば URL は(スニペットなしで)インデックスされることがあります。検索結果から除外したい場合は、クロールを許可したうえで noindex の robots メタタグか X-Robots-Tag ヘッダーを使ってください。
› どの AI クローラーをブロックしますか?
「学習用クローラーをブロック」では GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot など、モデル学習用にデータを集めるボットを追加します。「すべての AI ボットをブロック」ではさらに OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User など AI 検索のインデクサーやアシスタントの取得エージェントも加わり、AI の回答でページが引用されなくなる可能性があります。
› すべてのクローラーが robots.txt に従いますか?
信頼できる検索エンジンや主要な AI 企業は従うと表明していますが、robots.txt は慣習であってアクセス制御ではありません。スクレイパーは無視できるため、非公開のコンテンツは認証で守り、悪質なボットにはサーバーのルールやファイアウォールで対処してください。
› Crawl-delay は使えますか?
Bing や Yandex などは Crawl-delay を尊重しますが、Google は無視し、サーバーの応答速度に合わせてクロール頻度を自動調整します。