没有完全等价目标时,优先判断旧地址是否仍有独立价值:有则保留并改写,没有则让它返回410或404退出。不要为了省事把一批旧地址全部301到首页,这会让抓取规则把首页当成大量旧链接的落点,稀释后续判断。
三种常见情况需要分开处理。第一种是旧内容被拆分到多个新页面,任何单一新地址都无法承接全部语义。第二种是旧内容被合并进一个更大的新页面,但旧地址只对应其中一小段。第三种是旧内容已彻底下线,业务上不再提供。前两种适合保留或改写,第三种适合退出。
判断依据不是“新页面看起来像不像”,而是旧地址收到的外链、站内入口和用户直接访问是否仍有意义。假设某旧页面有若干外部引用,且这些引用指向的主题在新站仍有对应服务,那么直接退出会让这些引用落空;反之,若旧页面只是历史活动页且无引用,退出的代价很小。
保留意味着旧地址继续返回200,但内容改写为对新目标的引导或摘要。适用前提是:旧地址本身有稳定的外部链接或站内入口,且改写后能给用户一个明确的下一步。动作上,可以在旧页面顶部说明内容已迁移,正文保留核心信息,并给出指向新页面的链接。
这个动作的结果会影响下一步:如果改写后旧页面开始获得新的站内点击,说明它仍有独立价值,可以继续维护;如果长期没有点击且外链极少,就可以考虑转为退出。注意,保留不等于复制新页面全文,重复内容会让两个地址互相竞争。
当旧地址的语义被新页面覆盖了大部分,但并非完全等价,可以用301跳转到最接近的新页面,而不是首页。适用前提是:新页面确实包含旧地址的核心主题,且用户到达后不会觉得被误导。若旧地址对应的是新页面中的一个小节,也可以跳转到带锚点的地址,前提是该锚点稳定存在。
这里要避免一个常见做法:把大量旧地址统一跳转到首页。这样做在个别样本上可能看不出问题,但规模化后会出现例外——抓取规则会持续把首页当作这些旧链接的落点,导致首页被大量不相关信号覆盖,后续再想区分哪些旧地址真正有价值就变得困难。因此,跳转目标应当尽量具体。
退出指旧地址返回404或410,不再提供内容。适用前提是:旧地址没有值得保留的外链,站内也没有入口,用户直接访问的概率极低。410比404更明确地表示永久移除,但两者在抓取规则中的处理差异因搜索引擎而异,需要分别核查,不能假定某一个一定更快消失。
退出后要观察旧地址是否仍出现在站内链接、站点地图或外部引用中。如果仍有入口指向它,抓取规则会继续访问并得到404,这本身不是错误,但会浪费抓取预算。此时应优先清理站内入口,而不是反复提交移除请求。robots.txt的抓取限制不等于可靠的索引移除,它只阻止抓取,不保证已索引的地址会消失。
个别样本成立,不代表整批可以照搬。以下边界需要单独判断:
一个可操作的检查顺序是:先抽样确认旧地址的入口来源,再按组决定处理方式,最后观察处理后旧地址的抓取请求是否下降。请求量归零不能单独证明处理正确,它也可能是抓取延迟、站点地图未更新或外链自然消失造成的。把这些合理解释排除后,再决定是否调整下一批的处理方式。