要取得可复查的状态证据,核心做法是让每一次检查都能被第三方按相同步骤重复,并得到可对照的结果。具体来说,就是固定查询对象(具体网址)、固定查询工具(搜索引擎官方查询语法或日志)、固定时间戳,并把原始返回内容保存下来。下面这份清单按“查什么、怎么查、结果说明什么”组织,可直接执行。
查什么:一个可被独立访问的完整URL,而不是栏目页或首页。若一次要验证多个页面,逐条列出,不要合并成“网站整体收录情况”。
怎么查:从站点地图、内链或后台内容列表里复制规范网址,去掉跟踪参数,保留协议与路径。把这份URL清单存成文本文件,作为后续所有检查的基准。
结果说明什么:如果连查询对象都不统一,后续的收录状态、抓取日志、页面返回码就无法互相对应,证据链会断裂。这一步不产生结论,只保证后面每一步都可复核。
查什么:该URL当前是否被某搜索引擎索引,以及索引中显示的标题、摘要、缓存时间。
怎么查:在该搜索引擎的搜索框中输入 site: 加完整URL,记录返回条数与展示内容;再用引号包裹URL做精确查询,观察是否出现该页。分别对不同搜索引擎重复,不要用A引擎的结果推断B引擎。
结果说明什么:出现该URL,说明该引擎至少已建立索引记录;不出现,只说明当前查询未返回,不能直接断定“被删除”或“被惩罚”,可能是尚未抓取、被过滤或查询语法不匹配。把返回页面截图或保存HTML,并标注查询时间,否则同一查询在不同时间可能给出不同结果,无法复查。
查什么:robots.txt 是否禁止抓取该路径,以及该URL实际返回的HTTP状态码。
怎么查:直接访问 /robots.txt,找到匹配该路径的 Disallow 规则;再用命令行或在线头信息工具请求该URL,记录状态码与响应头中的 X-Robots-Tag,同时查看页面HTML里的 <meta name="robots">。
结果说明什么:robots.txt 的抓取限制只是阻止爬虫访问,并不等于可靠的索引移除——已被索引的URL可能仍出现在结果中,只是摘要无法更新。要真正影响索引,需要页面返回 noindex 或状态码为 404、410 等,并等待搜索引擎重新抓取。这里要区分“可能原因”和“已定位原因”:看到 Disallow 只能说明抓取被限制,不能断言这就是未收录的唯一原因。
查什么:搜索引擎是否请求过该URL,请求时间与返回状态。
怎么查:在站点地图中包含该URL并提交,但不要把它当作收录保证——站点地图只表达“希望被抓取”。真正的抓取证据来自服务器访问日志:按URL或按搜索引擎的User-Agent筛选,记录请求时间、状态码、响应大小。
结果说明什么:日志中出现该URL且状态码为200,说明爬虫已成功获取页面,未收录的原因更可能在内容质量或索引筛选环节;日志中完全没有记录,说明尚未抓取,此时应优先检查内链、站点地图和robots限制,而不是反复提交。把日志片段连同时间范围一起保存,这是最接近“客观发生事实”的证据。
site: 查询,记录条数与展示摘要,标注时间。X-Robots-Tag 和 meta robots。适用条件:这套方法适合“某个具体页面收录异常”的排查。若问题是整站流量下降,应改为按目录或模板分组抽样,逐组重复上述步骤。判断结果时,只有日志显示已抓取且状态码正常、但多个搜索引擎长期均不索引,才更值得转向内容与重复度核查。
下一步:选一个当前有疑问的URL,按上面五项做一次完整记录,并把结果与一周后的同一组查询对比,观察状态是否发生变化。