这个工具做什么
Robots.txt 生成器生成 robots.txt 文件,告诉爬虫可以抓取网站的哪些部分。选择主规则组的 User-agent,列出要禁止的路径和其中允许的例外,可选地加上抓取间隔和一个或多个站点地图网址,文件会随输入实时更新。
预设一键覆盖常见情况:全部允许、全部禁止(适合测试站),以及 WordPress 起始配置。单独的设置可以只屏蔽用于模型训练的 AI 爬虫,或者连同 AI 搜索和助手抓取程序全部屏蔽;还可以按名称屏蔽其他任何爬虫,比如 SEO 爬虫。路径、User-agent 名称和站点地图网址都会检查,漏写开头斜杠或填了相对的站点地图网址会直接提示,而不是悄悄生成一个有问题的文件。
使用方法
- 从预设开始,或者保留默认(全部允许)。
- 在禁止的路径里列出不让爬虫进入的目录或模式,用逗号分隔,例如
/admin/, /cart/, /*?sort=。其中的例外写在允许的路径里。 - 填上站点地图网址,搜索引擎不用另外提交也能找到它。
- 选择如何对待 AI 爬虫,并添加其他要屏蔽的爬虫。
- 下载为
robots.txt,上传到域名根目录,使其可以通过https://example.com/robots.txt访问。每个子域名都需要单独的文件。
示例
禁止 /admin/、例外允许 /admin/public/、添加站点地图并屏蔽 AI 训练爬虫,会得到:
# All crawlers
User-agent: *
Disallow: /admin/
Allow: /admin/public/
# AI training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
(这里省略了部分 AI 爬虫,工具会列出全部。)多行 User-agent 后跟规则构成一个组,对其中每个爬虫都生效;爬虫只遵循点名它的最具体的那一组。
小贴士
*匹配任意字符序列,$锚定网址结尾,所以/*.pdf$会屏蔽所有 PDF。- Allow 和 Disallow 同时匹配时,Google 采用最长(最具体)的那条规则。
- 不要屏蔽页面渲染需要的 CSS 和 JavaScript 文件,否则搜索引擎可能误判你的页面。
- 依赖新规则之前,先在 Google Search Console 的 robots.txt 报告里测试。
常见问题
› robots.txt 里的 Disallow 能把页面从 Google 删除吗?
不能。Disallow 只是让守规矩的爬虫不去抓取这个网址,但如果其他网站链接到它,网址仍可能被收录(不显示摘要)。要让页面不出现在搜索结果里,应允许抓取,并改用 noindex 的 robots meta 标签或 X-Robots-Tag 响应头。
› 工具会屏蔽哪些 AI 爬虫?
「屏蔽训练爬虫」会加入 GPTBot、ClaudeBot、anthropic-ai、Google-Extended、Applebot-Extended、CCBot、Bytespider、Meta-ExternalAgent、Amazonbot 等为模型训练收集数据的爬虫。「屏蔽所有 AI 机器人」还会加入 OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot、Perplexity-User 等 AI 搜索索引和助手抓取程序,这可能让你的页面不再被 AI 回答引用。
› 所有爬虫都遵守 robots.txt 吗?
正规搜索引擎和主要 AI 公司都表示会遵守,但 robots.txt 只是约定,不是访问控制。抓取程序可以无视它,所以私密内容要用登录保护,恶意爬虫要用服务器规则或防火墙处理。
› 支持 Crawl-delay 吗?
Bing、Yandex 等部分爬虫会遵守 Crawl-delay;Google 会忽略它,并根据服务器的响应速度自动调整抓取频率。