迁移后看到日志有搜索引擎来访,不等于页面已经进入索引;抓取是访问行为,索引是搜索引擎把页面存入可检索库的结果。判断顺序应是先确认抓取是否成功,再查索引是否收录,最后才看排名或流量。下面用一个假设例子说明时间和人手有限时先做什么。
假设你把一个WordPress站点从旧主机迁到新主机,第三天查服务器日志,看到Googlebot、Bingbot等UA有访问记录,但在搜索引擎里用site:查不到新页面。此时不要直接断定“没收录”,也不要因为日志有访问就认为“已经收录”。日志只能说明有抓取请求,不能说明抓取成功,更不能说明已进入索引。时间和人手有限时,先做下面三步。
抓取和索引之间隔着“抓取成功”这一关。迁移后常见错误是只看UA字符串,不看HTTP状态码。按以下检查项逐条核对:
robots.txt是否误屏蔽了整站或关键目录。robots.txt限制抓取,不等于可靠的索引移除;反过来,解除限制也不保证马上收录。只有确认抓取成功、返回200且未被robots.txt阻止,才进入索引检查。这一步判断结果很直接:状态码正常且内容可访问,抓取环节基本通过;状态码异常或跳转链过长,先修主机、DNS、重定向和内链,不要急着提交收录。
抓取成功后,索引结果要单独查。索引结果指页面是否进入搜索引擎的可检索库,和抓取日志是两回事。可以用site:加具体URL查询,也可以查页面是否出现在品牌词加标题的搜索结果中。不同搜索引擎支持情况须分别核查,Google、Bing、百度各自查各自的,不能用一个的结果推断另一个。
常见错误是把“搜不到”直接当成“没索引”。实际可能有三种情况:页面已索引但排名很低;页面被选为重复版本而未展示;页面被抓取但尚未处理。判断方法是看该URL是否出现在site:结果中,以及搜索结果里是否显示的是另一个URL。如果显示的是旧URL,说明迁移后的规范版本还没被采纳,需要检查301、canonical和站点地图是否一致。
时间和人手有限时,不要平均用力。按影响面排序,优先处理会阻断抓取或造成重复索引的项:
robots.txt没有误屏蔽,并让站点地图可访问。HTTPS不保证安全无漏洞或排名,证书只是迁移检查的一项,不是索引问题的解释。完成上述步骤后,下一步是选一个代表性URL,记录它的抓取状态码、canonical和索引查询结果,作为后续判断其他页面是否正常的基准。