“外链包收录”指的是把一批外链资源提交或发布后,观察这些链接是否被搜索引擎发现、抓取并进入索引。要取得可复查的状态证据,核心不是截图一张“已收录”结果,而是让每条外链的URL、检查时间、检查方式、结果和原始记录互相对应,使另一个人按同样步骤能复核。第一次接触这个问题,建议先选一小批链接做样本,固定检查口径,再决定是否扩大处理。
外链包里的链接状态至少可以分成三层:链接页面能否正常打开、搜索引擎是否抓取过该页面、该页面是否出现在索引中。三者不是同一件事。页面可访问不等于已抓取,已抓取不等于已索引,已索引也不等于该外链对目标页产生了什么作用。记录时要把这三层分开,否则后面无法判断问题出在哪一步。
需要特别注意:robots.txt的抓取限制不等于可靠的索引移除。被禁止抓取的页面仍可能因外部链接等原因出现在索引里,所以不能用“robots里禁了”当作已经移除的证据。站点地图也不保证收录,它只是提交候选URL的一种方式。HTTPS同样不保证安全无漏洞或排名,它只说明传输层加密,不能拿来做收录状态的证明。
一张能复查的记录表,至少要有下面这些字段。字段不全,复查时就会出现“当时看到过,现在说不清”的情况。
如果外链是发布在第三方平台上的,还要记录该平台页面是否要求登录、是否对未登录用户可见、是否可能因平台规则变化而删除。这些条件会影响复查能否复现。
假设你手上有20条外链,先不要全部铺开。按下面步骤取5条做样本:
判断结果时:如果页面可访问、robots允许抓取、日志有抓取记录、URL检查显示已索引,可以认为这条外链在当前检查时点处于可复查的已收录状态。如果页面可访问但URL检查显示未索引,可能原因包括页面质量不足、内容重复、抓取预算有限、链接本身不被信任等,这些是可能原因,不是已经定位的原因,需要继续用日志和页面内容分别验证。如果页面本身返回404或跳转到无关页面,那问题在外链资源本身,不在收录环节。
不同证据的获取成本和可信度不同,选择时要看你能接受多少复核成本。
如果只是第一次接触这个问题,建议从站内检索加URL检查工具开始,先建立记录口径。等确认口径稳定后,再决定是否接入日志或第三方工具。不要一开始就追求全量自动化,否则记录字段不统一,数据越多越难复查。
先建一张包含上述字段的表格,选5条外链做第一轮记录,隔一周用完全相同的方式复查一次。如果两次结果不一致,优先检查检查方式是否变化、页面是否被修改、robots规则是否调整,而不是直接下结论。等样本复查通过后,再把同样的口径扩展到整个外链包。