1. 这项检查是什么

很多企业站部署了 WAF(Web 应用防火墙)或反爬系统,拦截特征包括:频率稍高的访问、陌生 User-Agent、无浏览器指纹的请求。问题在于 AI 爬虫的访问特征恰好全中——它们不带浏览器指纹、UA 是「GPTBot」「ClaudeBot」这类新面孔。安全系统尽职地把它们当攻击挡在门外,你的网站对 AI 就「隐身」了。

2. 为什么影响 AI 可见度

被 WAF 拦截通常表现为:返回 403/429、要求浏览器验证(JS Challenge)、或跳转验证码页。AI 爬虫不会「通过验证」,直接放弃。和 A1(robots 拒绝)不同,这类拦截站长自己往往不知道——人工访问完全正常,只有机器视角被挡。这使它成为「网站很好但 AI 看不见」的第二大常见原因(第一大是 A3 JS 渲染)。

3. 如何自查

  1. 命令行模拟 AI 爬虫访问:curl -A "GPTBot" -s -o /dev/null -w "%{http_code}" https://你的域名 ——返回 200 正常;403/429/跳转验证页即被拦
  2. 对照测试:curl -A "Mozilla/5.0" ... 正常浏览器 UA 是否也异常(判断拦截范围)
  3. 登录 WAF/CDN 控制台看拦截日志里有没有 AI 爬虫 UA

4. 如何修复

在 WAF/CDN/防火墙中为主流 AI 爬虫加白名单(按你的安全产品找「UA 白名单」「爬虫放行」配置):

GPTBot、OAI-SearchBot(OpenAI)
ClaudeBot、Claude-Web(Anthropic)
CCBot(Common Crawl)
PerplexityBot
Google-Extended
Amazonbot
Bytespider(字节)
  • Cloudflare:安全规则里对上述 UA 设「跳过(Skip)」所有托管规则
  • 阿里云 WAF / 腾讯云 WAF:精准防护规则 → UA 匹配 → 放行动作
  • 自研反爬:把名单交给开发同学加进放行逻辑
  • 平衡安全性:只放行已知 AI 爬虫 UA,其余反爬策略保持不变

5. 修完如何验证

  1. 重复第 3 节的 curl 测试,各 AI UA 均返回 200
  2. 重跑本工具,A6 应显示通过
  3. 一周后观察 WAF 日志确认无新增拦截记录

6. 常见误区

  • 「反爬越严越好」:反爬的目标是防恶意抓取与攻击,不是屏蔽所有机器——把潜在「引用者」也挡了
  • 「我们的 WAF 是默认配置,没拦谁」:默认配置常含「境外 IP 高频拦截」「陌生 UA 人机验证」,AI 爬虫正中枪
  • 「放行 AI 爬虫会被拿去训练,亏了」:是否允许训练是商业选择(可用 robots.txt 单独控制某家),但「连内容都不给看」与「控制训练用途」是两件事