唯一事实来源:/srv/geo/rubric/rubric.yaml · 更新于 2026-09-20 ·
启用 20/21 项检查 ·
修改文件保存后自动热加载(校验失败沿用旧版,无需重启)
| 维度 | 名称 | 权重 | 状态 | 说明 |
|---|---|---|---|---|
| A | AI 可访问性 | 23% | 启用 | AI 爬虫能不能抓到、读到官网 |
| B | 内容可提取性 | 37% | 启用 | 内容是否容易被 AI 理解与引用 |
| C | 内容可信度 | 35% | 启用 | 内容是否值得 AI 采信(普林斯顿论文:数据/引用/权威表述显著提升被引率) |
| D | AI 可见性 | 5% | 启用 | 实测信号——主流爬虫联盟是否实际抓到过该站(Common Crawl 收录);后续扩展 AI 引擎引用监测。整组不适用(内网目标)时自动让出权重 |
| 编号 | 名称 | 维度 | 权重 | 判定依据 / 可调参数 |
|---|---|---|---|---|
| A1 | robots.txt 对 AI 爬虫的放行情况 多数建站模板默认屏蔽 AI 爬虫,是最常见也最致命的『隐形死刑』 |
A | 3 |
fail_blocked_min =
5bots =
GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、Claude-User、PerplexityBot、Google-Extended、CCBot、Bytespider |
| A2 | llms.txt AI 内容导览 llmstxt.org 社区规范,主动向 AI 引擎介绍站点结构(加分项) |
A | 1 | (无参数) |
| A3 | 原始 HTML 内容完整性(JS 依赖检测) 多数 AI 爬虫不执行 JS;纯前端渲染站点被抓到的是空壳 |
A | 3 |
fail_text =
400warn_text =
600min_ratio =
0.008containers =
app、root、__next、__nuxt、q-app |
| A4 | 技术基础(HTTPS / 响应速度 / 页面体积) HTTPS 是信任基础;速度与体积影响抓取效率 |
A | 2 |
slow_warn_s =
4.0size_warn_mb =
2.0 |
| A5 | sitemap.xml 站点地图 帮助 AI 爬虫系统性发现全站页面 |
A | 1 | (无参数) |
| A6 | 反爬 / WAF 拦截检测 人机验证会把真实 AI 爬虫挡在门外 |
A | 3 |
markers =
just a moment、cf-chl、challenge-platform、cf_chl、turnstile、滑动验证、请输入验证码、验证码、waf、punish、captcha |
| A7 | noindex 检测(meta robots / X-Robots-Tag) noindex 比 robots.txt 屏蔽更隐蔽,会让索引直接忽略页面 |
A | 3 | (无参数) |
| B1 | JSON-LD 结构化数据 结构化数据让 AI 确定性地识别企业与问答实体 |
B | 3 |
valuable_types =
Organization、Corporation、LocalBusiness、Product、FAQPage、QAPage、Article、NewsArticle、BreadcrumbList、WebSite、AboutPage、ContactPage |
| B2 | 语义化 HTML 结构(标题层级) 标题大纲是 AI 理解页面结构的主要线索 |
B | 2 | (无参数) |
| B3 | title / meta description / Open Graph 元信息是 AI 与搜索引擎理解页面的第一入口 |
B | 2 |
complete_min =
4partial_min =
2og_keys =
title、description、image |
| B4 | FAQ / 问答式内容 AI 引擎回答用户问题时最倾向引用 Q&A 结构的内容 |
B | 3 |
section_pattern =
常见问题|常见问答|FAQ|Q&A|问答min_question_headings =
2min_details =
3 |
| B5 | 正文文本量与文本密度 没有文本就没有可摘录的内容 |
B | 2 |
fail_text =
300fail_ratio =
0.008warn_text =
1200warn_ratio =
0.025 |
| B6 | 图片 alt 文本覆盖 alt 是 AI 理解图片语义的唯一线索 |
B | 1 |
pass_alt =
0.9warn_alt =
0.6 |
| B7 | canonical 规范化地址 多 URL 重复内容会稀释实体识别 |
B | 1 | (无参数) |
| B8 | 企业实体信息(名称/地址/电话/邮箱/备案) 一致且可机读的实体信息是 AI 建立企业知识的基础 |
B | 3 |
pass_min =
4warn_min =
2 |
| B9 | 实体外部锚点(sameAs:百科/社媒/地图) sameAs 帮助 AI 把官网与全网实体锚定为同一家企业(知识图谱一致性) |
B | 2 |
pass_min_categories =
2warn_min_categories =
1 |
| C1 | 内容具体性(事实密度) 普林斯顿论文:含统计数据的句子被引率提升 30~40%;关键词堆砌无效 |
C | 3 |
pass_facts =
8pass_case_kw =
2warn_facts =
3buzz_words =
领先、一流、卓越、顶尖、世界级、行业先进、极致、匠心、赋能、引领、知名 |
| C2 | 数据引用与内容新鲜度 普林斯顿论文:引用来源/数据显著提升可见度;新鲜度是采信信号 |
C | 2 |
min_pct =
2min_amounts =
1fresh_within_years =
1 |
| C3 | 权威信号(资质/荣誉/团队/合作) 权威表述与第三方背书提升 AI 采信度 |
C | 2 |
pass_min =
3warn_min =
1 |
| C4 | 引用就绪度测试(LLM 模拟客户提问) 规则测不了的『内容能否直接回答客户问题』由 LLM 判定;当前默认关闭以保持本地与线上形态一致,需要时把 enabled 改为 true 并配置 config/llm.json 即恢复 |
C | 3 |
pass_ratio =
0.8warn_ratio =
0.5 |
| D1 | Common Crawl 收录查询 主流开源爬虫联盟近期是否实际抓取过该站(许多 AI 的训练/检索数据源);被收录是被引用的必要非充分条件 |
D | 1 | (无参数) |