這個工具做什麼
Robots.txt 產生器產生 robots.txt 檔案,告訴爬蟲可以抓取網站的哪些部分。選擇主要規則群組的 User-agent,列出要禁止的路徑和其中允許的例外,可選擇加上抓取間隔和一個或多個網站地圖網址,檔案會隨輸入即時更新。
預設一鍵涵蓋常見情況:全部允許、全部禁止(適合測試站),以及 WordPress 起始設定。另一個設定可以只封鎖用於模型訓練的 AI 爬蟲,或連同 AI 搜尋和助理抓取程式全部封鎖;也可以依名稱封鎖其他任何爬蟲,例如 SEO 爬蟲。路徑、User-agent 名稱和網站地圖網址都會檢查,漏寫開頭斜線或填了相對的網站地圖網址會直接提示,而不是悄悄產生有問題的檔案。
使用方法
- 從預設開始,或保留預設值(全部允許)。
- 在禁止的路徑裡列出不讓爬蟲進入的目錄或模式,用逗號分隔,例如
/admin/, /cart/, /*?sort=。其中的例外寫在允許的路徑裡。 - 填上網站地圖網址,搜尋引擎不用另外提交也能找到它。
- 選擇如何對待 AI 爬蟲,並加入其他要封鎖的爬蟲。
- 下載為
robots.txt,上傳到網域根目錄,讓它可以透過https://example.com/robots.txt存取。每個子網域都需要各自的檔案。
範例
禁止 /admin/、例外允許 /admin/public/、加入網站地圖並封鎖 AI 訓練爬蟲,會得到:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(這裡省略了部分 AI 爬蟲,工具會列出全部。)多行 User-agent 後接規則構成一個群組,對其中每個爬蟲都生效;爬蟲只遵循點名它的最具體的那一組。
小提示
*符合任意字元序列,$錨定網址結尾,所以/*.pdf$會封鎖所有 PDF。- Allow 和 Disallow 同時符合時,Google 採用最長(最具體)的那條規則。
- 不要封鎖頁面算繪需要的 CSS 和 JavaScript 檔案,否則搜尋引擎可能誤判你的頁面。
- 依賴新規則之前,先在 Google Search Console 的 robots.txt 報告中測試。
常見問題
› robots.txt 裡的 Disallow 能把頁面從 Google 移除嗎?
不能。Disallow 只是讓守規矩的爬蟲不去抓取這個網址,但如果其他網站連結到它,網址仍可能被索引(不顯示摘要)。要讓頁面不出現在搜尋結果中,應允許抓取,並改用 noindex 的 robots meta 標籤或 X-Robots-Tag 回應標頭。
› 工具會封鎖哪些 AI 爬蟲?
「封鎖訓練爬蟲」會加入 GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot 等為模型訓練收集資料的爬蟲。「封鎖所有 AI 機器人」還會加入 OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User 等 AI 搜尋索引和助理抓取程式,這可能讓你的頁面不再被 AI 回答引用。
› 所有爬蟲都遵守 robots.txt 嗎?
正規搜尋引擎和主要 AI 公司都表示會遵守,但 robots.txt 只是慣例,不是存取控制。爬取程式可以無視它,所以私密內容要用登入保護,惡意爬蟲要用伺服器規則或防火牆處理。
› 支援 Crawl-delay 嗎?
Bing、Yandex 等部分爬蟲會遵守 Crawl-delay;Google 會忽略它,並依伺服器的回應速度自動調整抓取頻率。