用百度收录查询工具检查之前,最需要准备的不是工具本身,而是三样可核对的东西:要查的URL清单、这些URL允许被抓取的证据、以及判断“已收录/未收录”的验收标准。缺少其中任何一项,查询结果都只能算参考,不能作为结论。
查询工具的输入单位通常是具体网址,因此第一步是把待查范围列清楚。建议按以下顺序整理:
如果只拿一个首页去查,得到的结果无法反映整站状态。把清单写成表格,至少包含“URL、页面类型、期望状态(应收录/不应收录)、负责人”四列,后续核对才有依据。
查询收录前,要先排除抓取层面的障碍,否则查到的“未收录”可能只是抓取被挡住,而不是索引问题。需要核对的项目包括:
robots.txt 是否对目标路径设置了 Disallow。注意:robots.txt 的抓取限制不等于可靠的索引移除,被限制抓取的页面仍可能因外部链接等原因出现在结果中,所以它不能当作“删除收录”的手段。noindex 类指令。如果页面明确声明不索引,查询不到属于预期结果。这些检查项的作用是区分“可能原因”和“已经定位的原因”。例如查询不到某页面,可能是尚未被抓取,也可能是被 noindex 排除,还可能是URL写错。只有逐项核对后,才能把范围缩小到某一类。
单次查询容易出现误判,因此要准备可对照的辅助信息:
另外,HTTPS 只说明传输层加密,不保证页面没有安全漏洞,也不直接决定是否被收录,因此不要把“已启用HTTPS”当作收录的充分条件。
从交付结果倒推,还需要确定谁来做判断、什么情况算通过。建议在检查前写下:
假设某站点有 20 条新页面,其中 15 条能查询到、5 条查询不到。此时不应直接断定这 5 条被惩罚,而应先检查它们是否在站点地图中、是否有站内链接、是否被 noindex 标记、返回状态码是否正常。只有排除这些因素后,才进入下一步的内容质量与抓取频率判断。
把上述清单整理成一张表,先对 3 到 5 条代表性URL执行一次查询,记录结果与查询时间;对查询不到的URL,按抓取限制、页面指令、状态码、站内链接四项逐一核对,再决定是修改页面、补充入口,还是继续观察。