先给结论:入口页正常只能证明“可达”,不能证明“可继续发现”。当深层页面迟迟不出现时,最值得先查的是链路中的断点类型——是抓取被挡住、链接没有被解析,还是内容在渲染后才出现。把这三类分开,比反复提交入口页更有效。
入口页能正常被抓取,说明域名解析、服务器响应和入口本身没有整体性故障。深层页面缺失通常落在两种解释上。
第一种是抓取路径被挡。深层 URL 可能被 robots.txt 规则覆盖,或被服务器对特定路径返回 403、404、软 404。注意,robots.txt 的抓取限制并不等于可靠的索引移除,它只是阻止抓取,已收录页面仍可能留在结果中;反过来,解除限制也不保证马上恢复。
第二种是链接没有被解析或跟随。入口页上的深层链接可能由 JavaScript 在交互后才插入,或者用了百度无法稳定解析的跳转形式。此时入口页本身正常,但链路在“链接被发现”这一步就断了。
这两种解释的外部表现很像:入口页有收录,深层页没有。但处理动作完全不同,必须先区分。
不要只看“有没有收录”这一个信号。下面这组检查能给出可区分的证据,假设某站点入口页为 /list,深层页为 /item/1001:
<a href>,而不是依赖点击事件的按钮或纯脚本跳转。如果状态码正常、robots 未拦截,但初始 HTML 里没有深层链接,那么断点更可能在“链接发现”环节,而不是“页面抓取”环节。这个判断会直接改变下一步:前者要修链接输出方式,后者要修访问控制。
选定一个深层 URL,做一次受控修改:在入口页的初始 HTML 中,用普通 <a href> 直接输出该链接,不依赖脚本插入。修改后观察该 URL 是否出现抓取记录。
这里要说明假设:这个动作只验证“链接是否可被发现”,不承诺收录结果,也不代表其他深层页会同步变化。如果该 URL 随后被抓取,说明原断点在链接输出方式;如果仍无抓取,则应回到访问控制和路径规则继续排查。动作的结果决定下一步方向,而不是一次改完所有页面。
站点地图可以辅助提交,但它不保证收录,也不能替代页面内的可跟随链接。把站点地图当作补充信号,而不是断点修复手段。
常规做法都试过仍无效时,问题往往在一个被忽略的条件上:入口页与深层页是否处于同一可抓取上下文。
例如入口页允许抓取,但深层页所在目录被单独规则限制;或入口页是静态输出,深层链接由前端路由生成,百度拿到的初始 HTML 里根本没有这些地址。再比如分页、筛选参数把深层链接指向了同一批参数化 URL,导致有效地址被稀释。
排查顺序建议固定为:状态码与访问控制 → robots 匹配 → 初始 HTML 中的链接形式 → 参数与规范化。每一步只回答“断点是否在这里”,不要同时改多个变量,否则无法判断哪个动作起了作用。
最后提醒一点:请求量或抓取量下降,不能单独证明某个修复正确。服务器波动、抓取配额变化、站点整体结构调整,都可能产生相同现象。判断断点是否解除,应回到具体 URL 的可达性与可发现性证据上,而不是只看总量曲线。