先看中断前最后一批可核对的任务记录,再结合站点结构做抽样验证,不要因为进度条停在某个数字就认定“扫了多少”。中断后的覆盖范围判断,本质是把“已抓到的结果”和“应该覆盖的页面集合”分开统计,用可复现的证据缩小不确定区间。
假设你用旺道seo推广相关工具对一个小型内容站做全站扫描,任务在中途被网络波动或手动停止打断。界面显示已完成约七成,但导出结果里很多栏目页只有标题、没有正文指标。这个反差说明进度百分比和实际覆盖不是同一件事:百分比可能按请求数计算,而请求发出不等于内容解析成功。
此时先不要重跑全站。重跑会覆盖或追加旧记录,让“中断前覆盖了什么”更难还原。正确顺序是冻结当前结果,再判断缺口。
判断覆盖范围要区分三个层次,缺一层就不能说该页面已被有效扫描。
假设导出文件里某栏目有200条URL记录,其中180条状态码为200,但只有60条带完整标题和正文长度。那么“发现层”覆盖接近全量,“解析层”覆盖只有三成左右。报告里若只引用200这个数字,就会高估实际可用范围。
要判断缺了多少,先得知道分母。可以从站点地图、栏目导航、分页规则和已知的URL命名规律四条线索交叉核对。如果站点地图声明了1200个URL,而任务日志里只出现700个唯一URL,说明至少还有500个未被发现;这比进度条更可靠。
实际操作中,先取一个结构清晰的栏目做样本:列出该栏目全部已知页面,再与扫描结果求交集。假设某栏目已知80页,扫描结果命中52页,且缺失的28页集中在第二页之后的分页。这个结果指向一个具体原因——分页链接未被继续跟进,而不是全站随机漏抓。明确原因后,下一步只需补抓分页,而不是重跑全站。
中断后的数据往往会出现与直觉相反的现象,需要先排除解释,再下结论。
把这三类现象分别标注后,再决定补抓范围,能避免把“重复”和“空页面”误当成真实覆盖。
判断完成后,动作取决于缺口的位置和性质。
假设补抓后新增了300条URL,其中只有90条带完整字段,那么下一步不是继续扩大抓取量,而是回到解析规则检查为什么命中率仍然偏低。这个判断直接影响后续是继续补数据,还是先修工具配置。
最终判断覆盖范围时,至少保留以下可核对材料:任务日志中的唯一URL列表、状态码分布、带完整字段的记录数、站点地图声明的URL总数,以及抽样栏目的已知页面清单。这些材料互相印证,比单一进度数字更可靠。
需要说明的是,上述方法适用于站点结构相对清晰、URL可枚举的场景。如果站点大量依赖JavaScript渲染、登录后内容或无限滚动,发现层和解析层的缺口会更难界定,此时覆盖范围只能给出区间估计,并明确标注哪些部分尚未验证。具体工具的任务日志字段、导出格式和重试机制,需要以你实际使用的版本为准进行核对。