确定影响范围的第一步,不是马上改代码,而是先回答一个可验证的问题:受影响的到底是“所有页面”“某一类模板页面”,还是“个别 URL”。做法是用同一批 URL 样本,分别对照抓取状态、索引状态和搜索表现,看异常在哪个维度上成片出现。范围没定清就动手修,最常见的结果是把局部问题当成全站问题,改完反而引入新故障。
假设某站点上线新版商品详情页后,发现部分商品页在 Google 中消失。注意,下面所有数字和现象都是为说明方法而设的假设,不是真实项目数据。
这个顺序的意义在于:抓取、索引、展现是三个不同环节,异常表现相同,原因可能完全不同。范围判断要落到“哪一层、哪一类、哪种入口”上,而不是停在“收录变少了”。
站点通常由若干模板组成:首页、列表页、详情页、标签页、分页、搜索结果页、用户中心页。判断影响范围时,按模板分层比按 URL 总数更有用。
这里要区分“可能原因”和“已经定位的原因”。例如详情页大面积不索引,可能是模板加了 noindex,也可能是 canonical 指向了列表页,还可能是内容与其它页高度重复。在拿到实际页面源码之前,这些都只是候选解释,不能当成结论。
下面三项不需要特殊工具,用浏览器和命令行即可完成,适合第一次接触该问题时建立起点。
https://你的域名/robots.txt,确认没有用 Disallow: / 或误封关键目录。需要注意,robots.txt 的抓取限制不等于可靠的索引移除:被禁止抓取的 URL 仍可能因外部链接出现在索引中,所以它既不能用来精确控制收录,也不能当作移除手段。<meta name="robots" content="noindex">,并确认 canonical 指向的是页面自身而不是别的 URL。站点地图只帮助发现 URL,不保证收录,所以“已提交站点地图”不能作为页面应当被索引的依据。HTTPS 同理,它解决传输加密,不保证站点无漏洞,也不直接决定排名。
可以用一个简单标准验收:你能用一句话描述异常边界,并且这句话可以被反例检验。例如“所有带 ?sort= 参数的列表页都不再出现在索引中,而不带参数的同类页面正常”。这样的描述能直接指向下一步排查对象。
如果只能说“很多页面没了”,说明范围还没定清。此时继续抽样,直到异常组和对照组出现稳定差异。差异维度可以是模板、目录、参数、入口深度或发布时间,找到稳定差异,范围才算落地。
下一步:选定异常最集中的那一层,抽取 10 个 URL 做上面三项检查,把结果按“抓取、索引、入口”三列记录下来,再决定是改规则、改模板还是改内部链接。