做canonical检查前,至少要准备四类信息:页面清单与目标URL、当前页面上的canonical标签写法、页面之间的重复或近似关系、以及这些页面是否可被抓取和访问。没有这些信息,检查只能停留在“标签写没写”的表面,无法判断该用自引用canonical还是指向规范版本,也无法在实施后验证结果。
canonical解决的是“多个URL内容相同或高度相似时,告诉搜索引擎哪个是首选版本”。因此检查前必须有一份清单,列出参与比较的URL,并为每个URL写出你希望它指向的规范地址。清单至少包含:
这一步是整篇最关键的一步。如果目标规范URL没有提前确定,后面看到标签冲突时就没有判断依据。假设一个商品页同时存在/product/123和/product/123?color=red,你需要先决定规范版本是哪一个,而不是等检查时再临时决定。
准备信息时要区分标签写在HTML里、通过HTTP响应头返回,还是由JavaScript插入。检查前应记录:
rel="canonical"的完整href值,注意是绝对地址还是相对地址。这里要分清“可能原因”和“已经定位的原因”。看到canonical指向一个404页面,只能说明目标不可用,不能直接断定它导致了排名变化;需要结合抓取和索引数据继续核查。
canonical检查不是孤立看一个页面,而是看一组页面的关系。准备阶段应整理:哪些URL内容相同,哪些只是部分相似,哪些是分页序列,哪些是移动版与桌面版。同时确认这些URL是否允许抓取。robots.txt的抓取限制不等于可靠的索引移除,被阻止抓取的页面仍可能以其他方式出现在结果中,因此不能把“已屏蔽”当作canonical的替代方案。
站点地图可以帮助发现URL,但不保证收录。把URL放进站点地图,与这些URL是否被正确规范化是两件事,检查时要分开记录。
准备工作完成后,你会面对两种常见方案,适用条件不同:
选择依据不是“哪个更常见”,而是内容是否真的重复、业务上是否需要保留多个入口。如果两个页面面向不同地区或不同语言,canonical通常不是首选工具,应优先考虑其他标注方式。
实施canonical后,验证要回到准备阶段记录的信息:目标URL是否返回200、标签是否唯一、指向是否与计划一致。维护时定期复查,因为模板改版、URL结构调整、参数规则变化都可能让原本正确的canonical失效。检查项包括:
下一步建议:先完成那份URL与目标规范地址的对照清单,再逐页记录当前canonical写法。清单没有确定之前,不要急于修改标签。