先把结论说清楚:升级后评分变化,通常不是“网站本身突然变好或变差”,而是评分口径、可抓取样本和规则权重三者至少有一项发生了改变。要解释前后差异,不要拿升级前后的两个总分直接相减,而要把差异拆成“规则项—原始数据—计分方式”三层,逐项确认哪一层动了。只有当同一批页面、同一时间窗口、同一数据来源下重算仍出现差异,才值得怀疑是网站真实变化。
这是解释差异时最关键的分岔,两种条件的处理动作完全不同。
条件一:评分口径变了。典型证据是,用旧版本导出的明细项,在新版本里找不到同名项,或同一项的分母、上限、扣分区间被调整。此时前后总分不可比,因为尺子换了。正确动作是放弃总分对比,改为对每个规则项单独看“是否触发、触发程度”。如果某项在旧版叫“标题长度”,新版拆成“标题长度”和“标题重复度”,那旧版的低分不能直接归因到新版某一项。
条件二:数据样本变了。典型证据是规则项名称和计分方式基本一致,但参与评分的页面数量、可抓取比例或数据采集时间窗不同。比如升级后默认只分析已收录页面,而旧版分析全部提交链接。此时总分变化主要来自分母,不是页面质量。动作是先固定样本再重算:把两次分析都限定在同一批URL、同一时间区间内,再看差异是否收窄。
两种条件可能同时出现。判断顺序建议先看规则项清单是否一一对应,再看样本是否一致。规则项对不上,就先别谈数据;规则项对得上但样本不同,就先统一样本。
多个角色对同一评分有不同理解时,争论“到底哪个准”没有出口。更有效的做法是把分歧落成一张可逐项打勾的核对表,让每个人对同一项给出“是/否/不确定”。
核对表的价值在于:它把“我觉得新版更严”变成“第7项在两次分析中触发状态从否变为是,且依赖的原始数据来源不同”。后者可以被验证,前者只能被争论。
假设某页面在旧版工具中“内容质量”项得分较高,升级后同一项明显下降。不要直接下结论说内容变差了。按三层拆解,可能出现的情况是:新版该项改为基于渲染后的正文长度计算,而该页面正文由脚本注入,旧版只读原始HTML,读到的是空正文框架,反而因为“无冗余内容”给了高分;新版读到完整正文后,按段落重复度扣分。这里变化的是数据来源和计分逻辑,不是内容本身被改写。
这个例子的用途是说明比较方法:先固定页面、固定时间、固定数据来源,再逐项对比触发状态,而不是对比两个总分。实际工具是否采用渲染后DOM、是否计算段落重复度,需要以该工具的当前说明和实测导出为准,不能凭名称推断。
面对升级后的评分差异,建议按以下顺序动作,并让每一步的结果决定下一步:
如果四步走完后,可比项差异很小而总分差异很大,那总分差异主要来自不可比项或样本变化。此时对外解释应说“评分口径调整导致总分不可直接比较”,而不是给出一个笼统的“优化效果提升或下降”的结论。
有几种情形不适合用上述方法强行归因。第一,升级说明明确写了评分模型重构且未提供映射,此时前后总分在定义上就不连续,任何逐项对齐都是猜测。第二,两次分析间隔较长,期间网站确有内容、结构或外链变动,评分差异可能同时包含真实变化和口径变化,需要先缩小时间窗再判断。第三,工具对未收录或不可抓取页面的处理方式未知,若样本中这类页面占比高,评分可能反映的是采集覆盖差异而非页面质量。遇到这些情况,合理动作是记录“当前无法区分”,并说明需要补充哪类数据才能继续核对,而不是给出一个看似确定的解释。
归根结底,升级后的评分差异能不能解释,取决于你是否保留了升级前的明细基线、是否能固定同一批样本、以及规则项之间是否存在可验证的映射关系;这三项缺一项,结论的可靠程度就下降一层。