验证修复后的响应,不能只看百度索引查询里“已收录”或“未收录”这个结果,而要把修复动作拆成可复查的环节:先确认百度是否已经重新抓取修复后的页面,再确认抓取到的内容是否包含修复结果,最后看索引状态和搜索展现是否随之变化。只改页面、不触发抓取,或只提交链接、不核对返回内容,都可能让“修复完成”停留在主观判断上。
要查的是抓取时间是否晚于修复上线时间。进入百度搜索资源平台,在普通收录或抓取诊断相关功能中查看目标 URL 的最近抓取记录;如果平台没有可用记录,也可以用日志分析工具查看百度蜘蛛对目标 URL 的访问时间与返回状态。结果说明:抓取时间早于修复上线时间,说明百度看到的仍是旧版本,此时验证索引变化没有意义;抓取时间晚于修复上线时间且状态码为 200,才进入下一步内容核对。若返回 404、301 或 403,应先解决可访问性问题,而不是继续提交索引查询。
要查的是百度实际抓取到的 HTML 中,修复内容是否出现。用抓取诊断或“抓取如百度”类工具查看返回的 HTML 源码,搜索修复涉及的标题、正文段落、结构化数据或链接;如果修复针对的是渲染后的内容,还要查看渲染截图或渲染后 HTML。结果说明:源码中能看到修复点,说明修复对百度可见;源码中看不到,但浏览器里能看到,可能是内容由 JavaScript 渲染而百度未执行或未完成渲染,需要把关键内容改为服务端输出或检查渲染阻塞。这里要区分“可能原因”和“已定位原因”:源码缺失只是现象,渲染失败、缓存未更新、CDN 返回旧版本、模板未发布都可能造成同一现象,应逐项排查后再下结论。
要查的是目标 URL 在百度索引查询中的收录状态、快照或摘要是否已更新。在百度搜索框使用 site: 加完整 URL 查询,或通过搜索资源平台的索引量、普通收录状态查看。结果说明:查询结果仍显示旧标题、旧摘要或旧快照,通常说明索引尚未更新,可继续等待下一次抓取;查询结果显示新标题、新摘要,说明修复已进入索引层面。需要注意,robots.txt 的抓取限制不等于可靠的索引移除,若修复涉及删除内容或屏蔽页面,应使用合适的移除工具并确认返回状态,而不是只改 robots.txt 就认为索引会立即消失。站点地图也不保证收录,它只能帮助发现 URL,不能替代抓取与内容核对。
<title> 与 <meta name="description">,再观察搜索结果摘要是否更新。假设某页面把旧标题改为新标题,上线后抓取诊断显示百度仍返回旧标题,而浏览器显示新标题。此时可能是 CDN 或页面缓存返回旧版本,也可能是抓取时间早于发布时间。先核对抓取时间,再清除缓存并重新抓取,才能判断修复是否真正被百度看到。这个例子只说明排查顺序,不代表任何具体项目的实际结果。
下一步:选一个已修复的 URL,按上面的清单记录抓取时间、抓取内容和索引状态;如果抓取时间没有更新,先解决抓取触发问题,再继续做百度索引查询。