1. 这项检查是什么
robots.txt 是放在网站根目录的一个纯文本文件,用来告诉爬虫「哪些路径可以抓、哪些不要抓」。AI 时代的爬虫名单变长了:除了百度/谷歌,还有 GPTBot(OpenAI)、ClaudeBot(Anthropic)、CCBot(Common Crawl)、PerplexityBot、Google-Extended、Bytespider(字节)等。你的 robots.txt 如果写了对这些爬虫的 Disallow,或者写了影响全局的 Disallow: /,AI 就拿不到你的内容——网站本身好好的,但对 AI 来说等于不存在。
2. 为什么影响 AI 可见度
AI 引擎是否引用你的内容,第一步是「允许抓取」。robots.txt 是行业公认的君子协定,主流 AI 爬虫都会遵守。把 AI 爬虫拒之门外,后续所有优化(结构化数据、内容质量)都无从谈起。这也是为什么本项在「可访问性」维度权重较高:它是总开关。
3. 如何自查(不依赖工具)
- 浏览器打开
https://你的域名/robots.txt - 找
Disallow行:有没有Disallow: /(全站禁止)? - 对照 AI 爬虫名单,看有没有专门
User-agent: GPTBot等段落写了Disallow: / - 如果文件不存在或为空 → 默认全放行,本项反而是安全的
4. 如何修复
误写全站禁止(最常见事故,常见于网站改版期间临时屏蔽后忘了删):
User-agent: *
Disallow: / ← 删除或改为具体的后台路径,如 Disallow: /admin/
想放行 AI 但保留其他限制,明确写出允许:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: *
Disallow: /admin/
Disallow: /cart/
- 自建站:直接编辑根目录 robots.txt
- WordPress:后台「设置 → 阅读」的「建议搜索引擎不索引网站」勾选状态要检查,SEO 插件(Yoast/RankMath)里有 robots 文件编辑入口
- 外包团队:把上面两段示例发给技术人员,十分钟内可改完
5. 修完如何验证
- 重新访问
https://你的域名/robots.txt确认规则已生效 - 重跑本工具,A1 应显示通过
- 进阶:用 Google Search Console 的「robots.txt 测试工具」验证具体爬虫的抓取权限
6. 常见误区
- 「robots.txt 没配 = 有问题」:错。没有 robots.txt 时默认全部允许,反而是放行状态
- 「屏蔽了 GPTBot,ChatGPT 就完全不知道我」:不完全对——训练数据之外还有搜索插件路径,但主动屏蔽确实大幅降低可见度
- 「把 AI 爬虫全放行会拖慢网站」:主流 AI 爬虫抓取频率远低于搜索引擎爬虫,正常站点无感