1. 这项检查是什么

sitemap.xml 是放在根目录的站点地图文件,把网站所有页面的地址列成清单,并标注更新时间。导航栏只能露出十几个入口,而 sitemap 是完整的页面总目录——藏在三级菜单、新闻归档里的页面全靠它被发现。

2. 为什么影响 AI 可见度

无论是搜索引擎还是 AI 数据管道(如 Common Crawl),抓取都从少数入口开始沿链接走。链接层级太深的页面可能永远走不到。sitemap 把「该知道的所有地址」一次性摊开,显著提高全站被发现的比例——尤其对内容型、产品型号多的企业站。

3. 如何自查

  1. 访问 https://你的域名/sitemap.xml——能打开且是 XML 格式即存在
  2. 检查条目数量是否与实际页面量级匹配(一个 200 页的站地图里只有 10 条就说明生成不全)
  3. 访问 /robots.txt,里面应该有一行 Sitemap: https://你的域名/sitemap.xml 帮爬虫找到它

4. 如何修复

  • 自建站:路由固定的站手写也行;动态站在发布流程里自动生成(各语言生态都有成熟库)
  • WordPress:SEO 插件(Yoast/RankMath)开启即自动生成并保持更新
  • 外包团队:要求「全站页面自动生成 sitemap.xml 并在 robots.txt 中声明,新页面发布自动收录」

最小可用示例:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url><loc>https://example.com/</loc><lastmod>2026-09-01</lastmod></url>
  <url><loc>https://example.com/products</loc><lastmod>2026-08-15</lastmod></url>
</urlset>

5. 修完如何验证

  1. /sitemap.xml 可访问,条目数合理,无死链
  2. /robots.txt 里有 Sitemap 声明
  3. 重跑本工具,A5 应显示通过
  4. 搜索引擎侧:在百度站长/Google Search Console 提交一次加速收录

6. 常见误区

  • 「有了导航就够了」:导航是给「人」的入口,深层页面(历史新闻、细分型号)人也很少点,sitemap 是机器专用通道
  • 「一次性生成就不管了」:新页面不进地图等于白做,要保证自动更新机制
  • 「把后台、重复筛选页也全塞进去」:地图应列有真实内容的页面,垃圾页会稀释质量