DevToolPal
简

Robots.txt 生成器

生成 robots.txt:按 User-agent 设置允许和禁止的路径,添加站点地图和抓取间隔,一键屏蔽 AI 爬虫。

本地处理,不上传

选项

robots.txt

0 字符 · 0 B

这个工具做什么

Robots.txt 生成器生成 robots.txt 文件,告诉爬虫可以抓取网站的哪些部分。选择主规则组的 User-agent,列出要禁止的路径和其中允许的例外,可选地加上抓取间隔和一个或多个站点地图网址,文件会随输入实时更新。

预设一键覆盖常见情况:全部允许、全部禁止(适合测试站),以及 WordPress 起始配置。单独的设置可以只屏蔽用于模型训练的 AI 爬虫,或者连同 AI 搜索和助手抓取程序全部屏蔽;还可以按名称屏蔽其他任何爬虫,比如 SEO 爬虫。路径、User-agent 名称和站点地图网址都会检查,漏写开头斜杠或填了相对的站点地图网址会直接提示,而不是悄悄生成一个有问题的文件。

使用方法

  1. 从预设开始,或者保留默认(全部允许)。
  2. 在禁止的路径里列出不让爬虫进入的目录或模式,用逗号分隔,例如 /admin/, /cart/, /*?sort=。其中的例外写在允许的路径里。
  3. 填上站点地图网址,搜索引擎不用另外提交也能找到它。
  4. 选择如何对待 AI 爬虫,并添加其他要屏蔽的爬虫。
  5. 下载为 robots.txt,上传到域名根目录,使其可以通过 https://example.com/robots.txt 访问。每个子域名都需要单独的文件。

示例

禁止 /admin/、例外允许 /admin/public/、添加站点地图并屏蔽 AI 训练爬虫,会得到:

# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/

# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

(这里省略了部分 AI 爬虫,工具会列出全部。)多行 User-agent 后跟规则构成一个组,对其中每个爬虫都生效;爬虫只遵循点名它的最具体的那一组。

小贴士

  • * 匹配任意字符序列,$ 锚定网址结尾,所以 /*.pdf$ 会屏蔽所有 PDF。
  • Allow 和 Disallow 同时匹配时,Google 采用最长(最具体)的那条规则。
  • 不要屏蔽页面渲染需要的 CSS 和 JavaScript 文件,否则搜索引擎可能误判你的页面。
  • 依赖新规则之前,先在 Google Search Console 的 robots.txt 报告里测试。

常见问题

› robots.txt 里的 Disallow 能把页面从 Google 删除吗?

不能。Disallow 只是让守规矩的爬虫不去抓取这个网址,但如果其他网站链接到它,网址仍可能被收录(不显示摘要)。要让页面不出现在搜索结果里,应允许抓取,并改用 noindex 的 robots meta 标签或 X-Robots-Tag 响应头。

› 工具会屏蔽哪些 AI 爬虫?

「屏蔽训练爬虫」会加入 GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot 等为模型训练收集数据的爬虫。「屏蔽所有 AI 机器人」还会加入 OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User 等 AI 搜索索引和助手抓取程序,这可能让你的页面不再被 AI 回答引用。

› 所有爬虫都遵守 robots.txt 吗?

正规搜索引擎和主要 AI 公司都表示会遵守,但 robots.txt 只是约定,不是访问控制。抓取程序可以无视它,所以私密内容要用登录保护,恶意爬虫要用服务器规则或防火墙处理。

› 支持 Crawl-delay 吗?

Bing、Yandex 等部分爬虫会遵守 Crawl-delay;Google 会忽略它,并根据服务器的响应速度自动调整抓取频率。