DevToolPal
日本語

robots.txt ジェネレーター

robots.txt を作成します。User-agent ごとにパスを許可・拒否し、サイトマップとクロール間隔を追加、AI クローラーをワンクリックでブロック。

ローカルで処理、アップロードなし

オプション

robots.txt

0 文字 · 0 B

このツールについて

robots.txt ジェネレーターは、クローラーがサイトのどの部分を取得してよいかを伝える robots.txt ファイルを作成します。メインのルールグループの User-agent を選び、拒否するパスとその中で許可する例外を並べ、必要ならクロール間隔とサイトマップ URL(複数可)を追加すると、入力に合わせてファイルが更新されます。

プリセットでよくあるケースをワンクリックで設定できます。すべて許可、すべて拒否(ステージング環境向け)、そして WordPress 用の初期設定です。別の設定では、AI クローラーをモデル学習用だけブロックするか、AI 検索やアシスタントの取得エージェントも含めてすべてブロックするかを選べ、SEO クローラーなど任意のボットを名前でブロックすることもできます。パス、User-agent 名、サイトマップ URL はチェックされるので、先頭のスラッシュ忘れや相対形式のサイトマップは、壊れたファイルを黙って作る代わりにエラーとして表示されます。

使い方

  1. プリセットから始めるか、すべて許可のデフォルトのままにします。
  2. 拒否するパスに、クローラーを入れたくないフォルダーやパターンをカンマ区切りで入力します(例:/admin/, /cart/, /*?sort=)。その中の例外は許可するパスに入れます。
  3. サイトマップ URL を追加すると、検索エンジンは別途登録しなくても見つけられます。
  4. AI クローラーの扱いを選び、ほかにブロックしたいボットを追加します。
  5. robots.txt としてダウンロードし、https://example.com/robots.txt で配信されるようドメインのルートにアップロードします。サブドメインごとに個別のファイルが必要です。

例

/admin/ を拒否して /admin/public/ を例外として許可し、サイトマップを追加して AI の学習用クローラーをブロックすると、次のようになります。

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(AI のグループは一部省略しています。ツールではすべてのクローラーを列挙します。)複数の User-agent 行とそれに続くルールが 1 つのグループとなり、その全員に適用されます。クローラーは自分を名指しした最も具体的なグループだけに従います。

ヒント

  • * は任意の文字列に一致し、$ は URL の末尾を表すので、/*.pdf$ ですべての PDF をブロックできます。
  • Allow と Disallow の両方に一致した場合、Google は最も長い(具体的な)ルールを適用します。
  • ページの表示に必要な CSS や JavaScript はブロックしないでください。検索エンジンがページを誤って評価するおそれがあります。
  • 変更に頼る前に、Google Search Console の robots.txt レポートでテストしましょう。

よくある質問

› robots.txt の Disallow でページを Google から削除できますか?

できません。Disallow は行儀のよいクローラーに URL を取得させないだけで、他サイトからリンクされていれば URL は(スニペットなしで)インデックスされることがあります。検索結果から除外したい場合は、クロールを許可したうえで noindex の robots メタタグか X-Robots-Tag ヘッダーを使ってください。

› どの AI クローラーをブロックしますか?

「学習用クローラーをブロック」では GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot など、モデル学習用にデータを集めるボットを追加します。「すべての AI ボットをブロック」ではさらに OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User など AI 検索のインデクサーやアシスタントの取得エージェントも加わり、AI の回答でページが引用されなくなる可能性があります。

› すべてのクローラーが robots.txt に従いますか?

信頼できる検索エンジンや主要な AI 企業は従うと表明していますが、robots.txt は慣習であってアクセス制御ではありません。スクレイパーは無視できるため、非公開のコンテンツは認証で守り、悪質なボットにはサーバーのルールやファイアウォールで対処してください。

› Crawl-delay は使えますか?

Bing や Yandex などは Crawl-delay を尊重しますが、Google は無視し、サーバーの応答速度に合わせてクロール頻度を自動調整します。