先给结论:不要按“已收录 / 未收录”分组。这个分法把结果当成了分组依据,两组的差异可能来自页面本身,也可能只是百度先抓了哪一批。更稳的做法是按一个与收录结果无关、但可能影响被抓取概率的变量分组,例如页面生成时间、入口位置或模板版本,再比较组间发现率。
假设你一次上线了 200 个详情页,结构相同、内容都由同一模板渲染。过一段时间看,只有几十个出现在百度结果里。常见的第一反应是“未收录的页面质量差”,但模板相同意味着质量差异未必存在。
这里有两个都成立的解释:
这两个解释会导向完全不同的动作:前者应当等待并观察趋势,后者需要改内链或入口结构。不区分就动手,很容易把本来正常的页面改坏。
分组变量必须满足一个条件:它的取值在你看收录结果之前就已经确定,且不由“是否被收录”决定。可用的候选包括:
最常用的是入口深度。把页面分成“浅层入口组”和“深层入口组”,比较两组的被发现比例。如果浅层组明显更高,说明入口可发现性是主要矛盾;如果两组接近,则更可能是抓取节奏问题。
分组之后,需要看能区分解释的证据,而不是只看一个比例数字。
robots.txt 是否意外限制了部分路径。注意:robots.txt 的抓取限制不等于可靠的索引移除,被限制抓取也不代表页面一定不会出现在结果里,两者不能互相推断。一个假设例子:200 个页面中,浅层组 50 个被发现 40 个,深层组 150 个被发现 20 个。若两组内容质量接近,这个差距更可能来自入口深度。下一步动作是给深层页面增加稳定入口,例如从相关浅层页面添加链接,然后继续观察深层组的发现数量是否上升。如果上升,入口解释得到支持;如果不动,需要回到抓取节奏或页面本身继续排查。
没有日志、没有后台抓取数据时,仍然可以做一件事:手动构造一个入口对照组。选 10 个已发现页面和 10 个未发现页面,记录它们各自的入口深度、上级列表页、是否在站点地图中。这个样本不能证明因果关系,但能暴露明显的结构差异。
能执行的动作:把未发现页面中入口最深的几个,手动添加到已有浅层页面的相关链接中,然后过一段时间观察这些页面是否开始被抓取。结果会影响下一步——若开始被抓,说明入口是瓶颈;若仍无变化,则不应继续加链接,而应检查这些页面是否被其他规则挡住,或是否属于百度尚未优先处理的类型。
不能推出的结论:单个页面的抓取变化不能证明整批页面的规律;一次观察到的比例差异也不能直接归因于入口深度,因为批次、内容更新时间和外部链接都可能同时影响结果。
如果对照组的发现率差异不大,且未发现数量随时间缓慢增加,优先保持观察,不要批量改模板或改链接。如果浅层组和深层组差异稳定且明显,且深层组长期不动,再考虑调整入口结构。
另外,HTTPS 不保证页面安全无漏洞,也不保证排名;它不构成这里的分组变量。把精力放在入口可发现性和抓取节奏的区分上,比反复检查协议更有助于判断这批页面到底卡在哪一步。