1. 这项检查是什么

robots.txt 是放在网站根目录的一个纯文本文件,用来告诉爬虫「哪些路径可以抓、哪些不要抓」。AI 时代的爬虫名单变长了:除了百度/谷歌,还有 GPTBot(OpenAI)、ClaudeBot(Anthropic)、CCBot(Common Crawl)、PerplexityBot、Google-Extended、Bytespider(字节)等。你的 robots.txt 如果写了对这些爬虫的 Disallow,或者写了影响全局的 Disallow: /,AI 就拿不到你的内容——网站本身好好的,但对 AI 来说等于不存在。

2. 为什么影响 AI 可见度

AI 引擎是否引用你的内容,第一步是「允许抓取」。robots.txt 是行业公认的君子协定,主流 AI 爬虫都会遵守。把 AI 爬虫拒之门外,后续所有优化(结构化数据、内容质量)都无从谈起。这也是为什么本项在「可访问性」维度权重较高:它是总开关。

3. 如何自查(不依赖工具)

  1. 浏览器打开 https://你的域名/robots.txt
  2. 找 Disallow 行:有没有 Disallow: /(全站禁止)?
  3. 对照 AI 爬虫名单,看有没有专门 User-agent: GPTBot 等段落写了 Disallow: /
  4. 如果文件不存在或为空 → 默认全放行,本项反而是安全的

4. 如何修复

误写全站禁止(最常见事故,常见于网站改版期间临时屏蔽后忘了删):

User-agent: *
Disallow: /        ← 删除或改为具体的后台路径,如 Disallow: /admin/

想放行 AI 但保留其他限制,明确写出允许:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: *
Disallow: /admin/
Disallow: /cart/
  • 自建站:直接编辑根目录 robots.txt
  • WordPress:后台「设置 → 阅读」的「建议搜索引擎不索引网站」勾选状态要检查,SEO 插件(Yoast/RankMath)里有 robots 文件编辑入口
  • 外包团队:把上面两段示例发给技术人员,十分钟内可改完

5. 修完如何验证

  1. 重新访问 https://你的域名/robots.txt 确认规则已生效
  2. 重跑本工具,A1 应显示通过
  3. 进阶:用 Google Search Console 的「robots.txt 测试工具」验证具体爬虫的抓取权限

6. 常见误区

  • 「robots.txt 没配 = 有问题」:错。没有 robots.txt 时默认全部允许,反而是放行状态
  • 「屏蔽了 GPTBot,ChatGPT 就完全不知道我」:不完全对——训练数据之外还有搜索插件路径,但主动屏蔽确实大幅降低可见度
  • 「把 AI 爬虫全放行会拖慢网站」:主流 AI 爬虫抓取频率远低于搜索引擎爬虫,正常站点无感