判断采集是否遗漏,不能只看总抓取量或索引量有没有上涨,而要把“应被抓取的URL集合”与“实际被抓取的URL集合”做差集。这个差集里的URL才是遗漏候选。接下来要区分两种遗漏:一种是链接没被发现,另一种是发现了但没抓取或没入索引。只有先把差集做出来,再逐条验证,才能定位原因。
很多人把抓取频次或抓取量当作覆盖度指标。抓取量下降可能来自多种原因:站点整体响应变慢、抓取配额被分给了其他目录、重复内容被合并、参数URL被过滤。这些情况不一定意味着重要页面被遗漏。反过来,抓取量上涨也可能只是大量低价值URL被反复抓取,真正重要的页面仍然没被抓到。
正确判断的起点是集合对比,而不是总量对比。总量只能提示“可能有问题”,不能证明“哪里漏了”。
应抓集合的来源需要可核查,不能凭印象列几个页面。常见来源包括:
把这些来源合并去重后,得到一份基线清单。注意站点地图里的URL不等于一定会被抓取,它只是“你声明希望被抓取”的集合。站内可到达的URL才是更接近真实发现路径的集合。
实际集合可以从几类日志或报告获取:服务器访问日志中的搜索引擎爬虫记录、搜索引擎站长平台提供的抓取统计与索引覆盖报告、以及站内统计中带来源的落地页。这三类口径不同:
因此判断遗漏时,最好用日志或抓取统计做“是否被抓”的对比,用索引报告做“是否入索引”的对比。两者不能混为一谈。
把应抓集合减去实际抓取集合,得到遗漏候选。对每个候选URL,按下面顺序检查,而不是直接下结论:
假设示例:某站点地图提交了1000个URL,日志显示其中800个被爬虫访问过,索引报告显示600个已入索引。差集分析后可能得到:200个从未被抓取、200个被抓取但未入索引。前者要查入口和抓取预算,后者要查内容与重复。这个例子中的数字是假设,用来演示分类方法,不代表任何真实项目结果。
如果遗漏候选集中在深层目录、参数URL或新发布页面,优先检查内链结构和站点地图更新频率。如果遗漏候选分散且无规律,优先检查服务器稳定性和抓取频次限制。如果遗漏候选都是低质量或重复页面,那可能不是遗漏,而是搜索引擎主动筛选,此时补入口也不会带来索引。
需要强调的是,第三方估算流量、搜索引擎报告与站内统计的口径不同,不能互相替代。单靠某一个指标无法还原搜索算法的判断过程,只能作为证据链中的一环。判断采集遗漏的核心动作始终是:建立应抓集合、采集实际集合、做差集、逐条验证。
下一步可以选一个栏目做小范围试验:导出该栏目全部已发布URL,与近30天爬虫日志做差集,按上面的六项逐一核对。先在一个可控范围内验证方法,再决定是否扩大到全站。