先给结论:入口页面正常,只说明抓取与索引链路的起点没有断;深层页面迟迟不出现,断点通常落在“入口到深层”的中间层。定位方法是沿链路逐段做可抓取、可发现、可索引三层验证,而不是反复提交入口页。下面按“保留旧结构”和“准备下线旧结构”两种条件给出不同做法。
条件一:旧栏目或旧系统仍有部分内容要继续使用,只是深层页面收录慢。此时应保留链路,只修复断点,不建议整段下线。
条件二:旧栏目、旧合作关系或旧系统整体准备退出,只有少数深层页面仍有价值。此时应把有价值页面迁到新路径,再让旧链路整体退出,而不是逐个修补旧深层页。
区分依据不是入口页是否正常,而是深层页面是否还有独立价值:有持续访问价值或转化价值,选条件一;只是历史遗留、内容已被新页覆盖,选条件二。
入口页正常,不代表深层页能被发现。检查入口页是否真的链接到深层页,而不是只靠脚本渲染后才出现链接。若链接只存在于交互之后,抓取端可能看不到。
实际动作:用纯文本方式查看入口页,确认深层链接是否直接出现在 HTML 中。若链接缺失,把关键深层入口改为静态可读链接。结果会直接影响下一步:链接补上后,继续观察深层页是否被抓取;若仍无变化,问题不在发现层,转向第二层。
断点常出现在中间目录页或分页。检查这些层是否被 robots.txt 拦截、是否返回错误状态、是否因参数过多导致同一内容出现多个地址。
需要明确:robots.txt 的抓取限制不等于可靠的索引移除。它只阻止抓取,已收录地址可能仍留在结果中;反过来,解除限制也不保证立即恢复收录。站点地图同样不保证收录,它只帮助发现。
实际动作:抽查中间层返回的状态码,并核对是否存在多个可访问地址指向同一深层内容。若发现重复地址,选定一个规范地址,其余做跳转或规范化处理。结果影响下一步:中间层恢复可抓取后,再判断深层页是否进入索引候选;若中间层本身无价值,直接进入条件二。
深层页即使被抓取,也可能因内容重复、正文为空、依赖脚本渲染而无法进入索引。入口页正常会掩盖这一点,因为入口页往往内容完整。
实际动作:抽取几个深层页,确认正文在无脚本状态下是否可见,并检查是否存在与其它页面高度重复的标题和正文。若正文不可见,先解决渲染或内容输出;若高度重复,先决定保留哪一个版本。
条件一(保留旧结构):按“发现层—中间层—深层页”顺序修复,一次只改一层,改完观察该层是否恢复可抓取,再进入下一层。这样能把断点范围缩小到具体一层,而不是同时改动多处导致无法判断原因。
条件二(准备下线):先列出仍有价值的深层页,把它们迁到新路径并保留可访问入口,再让旧中间层和旧深层整体退出。退出时不要只靠 robots.txt 拦截,因为拦截不等于移除;对确实要下线的地址,按可访问状态和跳转规则处理。
短例子(假设):某旧栏目有 200 个深层页,其中 20 个仍有访问价值。若逐个修补旧链路,需要维护整套旧中间层;若只迁移 20 个页面到新路径,其余整体退出,维护面更小。这个比较只说明取舍方法,不构成任何效果承诺。
请求量或抓取量归零,不能单独证明处理正确。它也可能是抓取预算转移、中间层被拦截、地址变更后旧地址不再被请求等合理解释。需要结合中间层状态、深层页可访问性和实际访问来源一起判断。
另一个误判是把 HTTPS 当作收录保障。HTTPS 不保证安全无漏洞,也不保证排名或收录。若深层链路失效发生在证书或跳转环节,应单独核查跳转链是否可完成,而不是假定加密就等于链路正常。
最后,不同搜索引擎对同一链路的支持情况须分别核查,不能把一种引擎的表现直接套到另一种。定位断点时,先固定一个引擎的观察结果,再决定是否扩大范围。