核心判断是:不要为了“每个旧地址都有去处”而把不相关的旧页面批量指向首页或栏目页。对Baiduspider抓取而言,旧地址没有完全等价目标时,优先选择两种处理之一:能返回与旧内容最接近的替代页时用301,找不到替代页时让旧地址返回410或404并停止内部链接。前者传递的是“这个资源换了位置”,后者传递的是“这个资源不再存在”。两者都比软404或全站跳首页更可判断。
假设有一个旧产品页 /old-product-a,迁移后新产品页合并了三个旧型号,内容主题相近但不完全对应。这个情境只用于说明决策方法,不代表任何真实站点。此时先判断旧地址属于哪一类:
这三种情况的共同点是:等价目标是否存在,不取决于旧地址数量,而取决于旧页的核心意图是否在新站有对应承接。
把决策压缩成两个可操作的选择,比逐个旧地址凭感觉跳转更稳。
成立条件包括:新旧页面主题一致或高度重叠;新页能回答旧页访问者的主要问题;旧页的外链和内部链接仍有价值。动作上,把旧地址301到最接近的新地址,并检查新页是否可被抓取、是否返回200。结果会影响下一步:如果新页本身是登录墙、空列表或需要交互才显示内容,Baiduspider抓取到的可能是空壳,这时301只是把问题转移,下一步应先让新页有稳定可见内容,再保留跳转。
成立条件包括:没有主题对应的新页;旧页没有必须保留的导航价值;继续保留旧地址会制造重复或过期信息。动作上,让旧地址返回410,并从站点导航、站点地图和内部链接中移除。结果会影响下一步:如果一段时间后仍有大量内部链接指向该地址,抓取请求可能持续出现,这时要回去清理链接,而不是反复改状态码。需要说明的是,robots.txt 的抓取限制不等于可靠的索引移除;对已收录旧地址,屏蔽抓取可能让抓取方无法看到410,反而延长旧信号的存续判断。
单个旧页301到新页看起来有效,不代表可以批量套用。规模化后常见的例外有三类:
因此,批量处理前应先抽样:从旧地址中按模板、目录和内容类型各取若干条,检查跳转目标是否返回200、是否有稳定可见内容、是否与旧页主题接近。样本通过后再扩大,样本不通过就回到分类,而不是直接全量301。
面对旧地址没有完全等价目标时,按以下顺序处理:
这套顺序的重点不是追求旧地址“全部有跳转”,而是让每个旧地址的状态码与内容现实一致。能等价替代就301,不能替代就410,拿不准时先保留旧页可访问,直到新站出现明确承接页再改。站点地图不保证收录,HTTPS也不保证安全无漏洞或排名,它们都不能替代这个判断。