DevToolPal
繁

Robots.txt 產生器

產生 robots.txt:依 User-agent 設定允許和禁止的路徑,加入網站地圖和抓取間隔,一鍵封鎖 AI 爬蟲。

本機處理,不會上傳

選項

robots.txt

0 字元 · 0 B

這個工具做什麼

Robots.txt 產生器產生 robots.txt 檔案,告訴爬蟲可以抓取網站的哪些部分。選擇主要規則群組的 User-agent,列出要禁止的路徑和其中允許的例外,可選擇加上抓取間隔和一個或多個網站地圖網址,檔案會隨輸入即時更新。

預設一鍵涵蓋常見情況:全部允許、全部禁止(適合測試站),以及 WordPress 起始設定。另一個設定可以只封鎖用於模型訓練的 AI 爬蟲,或連同 AI 搜尋和助理抓取程式全部封鎖;也可以依名稱封鎖其他任何爬蟲,例如 SEO 爬蟲。路徑、User-agent 名稱和網站地圖網址都會檢查,漏寫開頭斜線或填了相對的網站地圖網址會直接提示,而不是悄悄產生有問題的檔案。

使用方法

  1. 從預設開始,或保留預設值(全部允許)。
  2. 在禁止的路徑裡列出不讓爬蟲進入的目錄或模式,用逗號分隔,例如 /admin/, /cart/, /*?sort=。其中的例外寫在允許的路徑裡。
  3. 填上網站地圖網址,搜尋引擎不用另外提交也能找到它。
  4. 選擇如何對待 AI 爬蟲,並加入其他要封鎖的爬蟲。
  5. 下載為 robots.txt,上傳到網域根目錄,讓它可以透過 https://example.com/robots.txt 存取。每個子網域都需要各自的檔案。

範例

禁止 /admin/、例外允許 /admin/public/、加入網站地圖並封鎖 AI 訓練爬蟲,會得到:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(這裡省略了部分 AI 爬蟲,工具會列出全部。)多行 User-agent 後接規則構成一個群組,對其中每個爬蟲都生效;爬蟲只遵循點名它的最具體的那一組。

小提示

  • * 符合任意字元序列,$ 錨定網址結尾,所以 /*.pdf$ 會封鎖所有 PDF。
  • Allow 和 Disallow 同時符合時,Google 採用最長(最具體)的那條規則。
  • 不要封鎖頁面算繪需要的 CSS 和 JavaScript 檔案,否則搜尋引擎可能誤判你的頁面。
  • 依賴新規則之前,先在 Google Search Console 的 robots.txt 報告中測試。

常見問題

› robots.txt 裡的 Disallow 能把頁面從 Google 移除嗎?

不能。Disallow 只是讓守規矩的爬蟲不去抓取這個網址,但如果其他網站連結到它,網址仍可能被索引(不顯示摘要)。要讓頁面不出現在搜尋結果中,應允許抓取,並改用 noindex 的 robots meta 標籤或 X-Robots-Tag 回應標頭。

› 工具會封鎖哪些 AI 爬蟲?

「封鎖訓練爬蟲」會加入 GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot 等為模型訓練收集資料的爬蟲。「封鎖所有 AI 機器人」還會加入 OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User 等 AI 搜尋索引和助理抓取程式,這可能讓你的頁面不再被 AI 回答引用。

› 所有爬蟲都遵守 robots.txt 嗎?

正規搜尋引擎和主要 AI 公司都表示會遵守,但 robots.txt 只是慣例,不是存取控制。爬取程式可以無視它,所以私密內容要用登入保護,惡意爬蟲要用伺服器規則或防火牆處理。

› 支援 Crawl-delay 嗎?

Bing、Yandex 等部分爬蟲會遵守 Crawl-delay;Google 會忽略它,並依伺服器的回應速度自動調整抓取頻率。