重复页面排查的核心是:把“内容相同或高度相似、但URL不同”的页面找出来,判断哪一个是应保留的主版本,其余通过合并、跳转或删除处理。排查不是看页面长得像不像,而是看标题、正文主体、产品参数、分页与筛选参数是否产生多入口。多人协作时,建议先固定一份“重复页面清单”,记录URL、重复类型、处理动作和复查日期,避免不同人重复改同一批页面。
不要一上来就全站抓取。先看哪些页面有重复嫌疑,通常从三个入口观察:
?color=red、?page=2、?sort=price是否被单独收录。/product/123与/goods/123.html同时可访问。观察阶段只记录,不急着删。多人协作时,让每个成员按同一张表填写,避免有人改标题、有人删页面,最后无法对照。判断结果:如果两个URL的正文主体几乎一致,只是参数或路径不同,就进入下一步判断。
重复页面不是一种原因,处理方式也不同。可以用下面的对照表判断:
www与不带www、带斜杠与不带斜杠。判断依据是两个URL返回相同内容且状态码正常。这里要区分“可能原因”和“已经定位的原因”。例如两个URL内容相同,可能是参数导致,也可能是服务器配置导致,不能只凭一个现象就断言唯一原因。需要逐项核对HTTP状态码、规范标签和页面主体。
处理重复页面时,优先保留有独立价值、有外部链接、有搜索流量的版本。具体动作可以按以下顺序执行:
<link rel="canonical">指向主版本。noindex,但不要同时用robots.txt屏蔽又指望noindex生效。假设一个服装站有/shirts?color=red和/shirts?color=blue两个页面,正文主体相同,只是筛选颜色不同。若颜色筛选没有独立搜索需求,可以把这两个URL规范到/shirts;若红色衬衫有独立搜索量,则应保留独立页面并补充独特描述。这个例子是假设,用于说明判断条件,不是真实项目结果。
处理完成后,不要立刻下结论。复查时至少核对以下项目:
比较改动前后数据时,要考虑季节、搜索需求变化和数据采集差异。例如促销期流量自然上升,不能把上升全部归因于重复页面处理。多人协作交付时,复查表中应写明“谁在什么日期检查了哪一项”,减少返工。
下一步:从你当前站点中选出10个标题或路径相近的URL,填入同一张重复页面清单,先判断类型,再决定合并、规范还是删除。