1. 这项检查是什么
很多企业站部署了 WAF(Web 应用防火墙)或反爬系统,拦截特征包括:频率稍高的访问、陌生 User-Agent、无浏览器指纹的请求。问题在于 AI 爬虫的访问特征恰好全中——它们不带浏览器指纹、UA 是「GPTBot」「ClaudeBot」这类新面孔。安全系统尽职地把它们当攻击挡在门外,你的网站对 AI 就「隐身」了。
2. 为什么影响 AI 可见度
被 WAF 拦截通常表现为:返回 403/429、要求浏览器验证(JS Challenge)、或跳转验证码页。AI 爬虫不会「通过验证」,直接放弃。和 A1(robots 拒绝)不同,这类拦截站长自己往往不知道——人工访问完全正常,只有机器视角被挡。这使它成为「网站很好但 AI 看不见」的第二大常见原因(第一大是 A3 JS 渲染)。
3. 如何自查
- 命令行模拟 AI 爬虫访问:
curl -A "GPTBot" -s -o /dev/null -w "%{http_code}" https://你的域名——返回 200 正常;403/429/跳转验证页即被拦 - 对照测试:
curl -A "Mozilla/5.0" ...正常浏览器 UA 是否也异常(判断拦截范围) - 登录 WAF/CDN 控制台看拦截日志里有没有 AI 爬虫 UA
4. 如何修复
在 WAF/CDN/防火墙中为主流 AI 爬虫加白名单(按你的安全产品找「UA 白名单」「爬虫放行」配置):
GPTBot、OAI-SearchBot(OpenAI)
ClaudeBot、Claude-Web(Anthropic)
CCBot(Common Crawl)
PerplexityBot
Google-Extended
Amazonbot
Bytespider(字节)
- Cloudflare:安全规则里对上述 UA 设「跳过(Skip)」所有托管规则
- 阿里云 WAF / 腾讯云 WAF:精准防护规则 → UA 匹配 → 放行动作
- 自研反爬:把名单交给开发同学加进放行逻辑
- 平衡安全性:只放行已知 AI 爬虫 UA,其余反爬策略保持不变
5. 修完如何验证
- 重复第 3 节的 curl 测试,各 AI UA 均返回 200
- 重跑本工具,A6 应显示通过
- 一周后观察 WAF 日志确认无新增拦截记录
6. 常见误区
- 「反爬越严越好」:反爬的目标是防恶意抓取与攻击,不是屏蔽所有机器——把潜在「引用者」也挡了
- 「我们的 WAF 是默认配置,没拦谁」:默认配置常含「境外 IP 高频拦截」「陌生 UA 人机验证」,AI 爬虫正中枪
- 「放行 AI 爬虫会被拿去训练,亏了」:是否允许训练是商业选择(可用 robots.txt 单独控制某家),但「连内容都不给看」与「控制训练用途」是两件事