SEO诊断分析:怎样判断采集是否遗漏——用覆盖清单核对
📍 WDQWDWQD987AAAAA:216.73.217.80
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /6db20fd3ca0a.html
📄
SEO诊断分析:怎样判断采集是否遗漏——用覆盖清单核对
判断采集是否遗漏,不能只看“收录了多少条”,而要把应采集合集与实际采集合集做差集。做法是:先确定页面来源清单,再用站内日志、站点地图和数据库记录交叉比对,找出只出现在来源、却没有进入采集结果的URL。差集不为空,就说明存在遗漏;差集为空,也只能说明在本次口径下没有发现遗漏。
先定义“应采集”,否则无法判断遗漏
遗漏是相对目标集合而言的。多人协作时,最容易返工的地方就是每个人心里的“应采集”不一样。交付前先把口径写清楚:
- 来源范围:栏目页、列表页、站点地图、历史存档、外部导入表,哪些算,哪些不算。
- URL规则:带参数的页面、分页、标签页是否纳入;重复URL以哪个为准。
- 时间边界:只查某个时间段新增,还是全量核对。
- 状态要求:只要求抓取到,还是要求解析成功并入库。
这份口径就是后续判断遗漏的基准。没有它,任何“好像少了几条”都只是感觉。
观察:用三条证据链找差集
不要依赖单一指标。第三方估算流量、搜索引擎报告和站内统计口径不同,都不能单独还原采集全貌。可核对的做法是:
- 从来源侧导出URL清单,去重后得到集合A。
- 从采集侧导出已处理URL清单,得到集合B。
- 计算A减B,得到候选遗漏清单。
如果条件允许,再补两条证据:站点地图中的URL是否都出现在B中;站内日志里被访问过的URL是否都进入过采集流程。三条证据指向同一批URL时,遗漏判断的可信度最高。
判断:区分“真遗漏”和“口径差异”
差集里的URL不一定都是遗漏。逐条检查以下情况:
- 规范化导致合并:带与不带尾斜杠、大小写不同、参数顺序不同,可能被视为同一页面,只保留一条。这属于去重,不是遗漏。
- 规则主动排除:robots限制、登录墙、非HTML文件、重复模板页被规则过滤。若口径本就不要求采集,应从A中剔除。
- 抓取失败未重试:超时、状态码异常、解析报错后没有进入重试队列。这类是处理遗漏,需要看错误日志确认,而不是直接断言采集器漏抓。
- 发现链路断裂:页面存在,但没有任何入口链接指向它,站点地图也没收录,导致始终没被发现。这是发现遗漏。
只有排除前两类后,剩下的才进入处理清单。把判断依据写进交付文档,能显著减少协作中的反复确认。
处理与复查:让遗漏可复现、可验证
对确认遗漏的URL,按原因分派处理:发现遗漏就补入口或补站点地图;抓取失败就重跑并记录错误;解析失败就修规则后重放。处理完不要只看“任务成功”,要重新计算一次差集:
A - B_new
如果结果为空,说明这批URL已进入采集结果;如果仍有剩余,检查它们是否属于口径外或仍处于重试队列。复查时保留处理前后的清单文件,标注每条的归属,方便他人复核。
多人协作时的交付检查项
- 口径文档是否写明来源、规则、时间边界和状态要求。
- 差集清单是否标注了每条的原因分类,而不是只给一个数量。
- 错误日志、重试记录和最终清单是否放在同一交付目录。
- 复查是否由未参与处理的人按同一口径重算一次。
下一步:选一个已有明确来源清单的小范围栏目,按上述步骤做一次差集核对,把口径、差集和处理记录整理成模板,再推广到全站。