批量查询时,如果首页或栏目页仍显示已收录,而更深的详情页整批消失,问题通常不在入口本身,而在入口到深层页之间的某一段链路。定位断点的关键不是继续查首页,而是把深层页按可抓取、可解析、可索引三个环节拆开,用同一批样本分别验证,看结果在哪一步开始分叉。
入口页面正常只能说明百度仍能访问站点根路径和部分栏目,不能证明深层页的抓取路径畅通。深层链路通常经过列表页、分页、筛选参数、详情模板和内容加载方式,任何一段被阻断,批量查询都会表现为深层结果整体缺失。
两个常见解释需要先分开:一是抓取层被切断,百度根本到不了深层页;二是抓取层正常,但页面返回的内容不足以被当作独立可索引对象。两者在批量查询里都表现为“深层没收录”,但修复方向完全不同。
选取同一栏目下、同一模板生成的若干深层页,保证它们只在一个变量上不同,例如是否依赖前端渲染、是否带筛选参数、是否在站点地图中列出。然后分别检查:
如果直接请求返回正常内容,而批量查询仍不收录,说明问题更可能在索引判断层;如果直接请求就返回空壳、错误状态或跳转,则断点在抓取层。这个区分动作会直接决定下一步是改链路还是改页面内容。
站点地图列出深层页,只代表你声明了这些地址,不保证百度会抓取或收录。robots.txt 禁止抓取某段路径,会阻止百度访问,但抓取限制不等于可靠的索引移除;反过来,放开 robots.txt 也不等于深层页会立即恢复。
可操作的判断是:先确认深层页是否被 robots.txt 误伤,再确认站点地图中的地址是否与真实可访问地址一致。如果两者都正常,却只有深层页批量失效,应把注意力转回页面本身的可见内容和内部链接。
假设某站列表页第一页正常,第二页开始使用带参数的地址,且第二页之后的详情链接只在脚本执行后才生成。入口页面和第一页详情仍被收录,第二页之后的深层页批量消失。
此时可做的动作是:把第二页的详情链接改为初始 HTML 中可抓取的普通链接,并保留原有参数地址作为用户访问入口。修改后重新提交受影响地址,观察下一轮批量查询中深层页是否开始出现。若出现,说明断点在“初始响应中没有可跟随链接”;若仍不出现,则要继续检查页面主体是否被判定为重复或空内容。
每一步的结果都会缩小下一步范围:直接访问失败就先修链路,直接访问正常但初始响应为空就先修内容输出,声明层正常而内容也正常,才需要进一步看页面是否被当作低价值重复对象。批量查询的价值在于把个别样本的结论放到规模化场景中验证,而不是用入口页面的正常结果掩盖深层链路的失效。