分组后结论与总体相反,通常不是工具算错,而是总体指标和分组指标使用了不同的分母。要查清这一点,先把每个分组的分母写出来,再对照总体的分母定义,看它们是否来自同一批链接、同一时间窗口和同一去重规则。若两个分母口径不同,分组结论不能直接推翻总体结论;若口径一致,才需要继续检查分组是否漏掉了某类链接。
外链检测工具通常同时给出多个指标:链接总数、引用域数量、有效链接数、失效链接数、nofollow 比例等。先明确相反的是哪一个,不要笼统地说“分组和总体不一样”。例如总体看引用域在增长,但按来源类型分组后,目录类引用域在下降,这并不矛盾,因为总体增长可能来自另一类来源。只有同一个指标、同一个时间窗口、同一批数据,才构成需要排查的“相反”。
把总体和分组各自的分子、分母写成一行:分子是什么,分母是什么,去重发生在哪一步。这个动作本身就能排除一部分假矛盾。
第一种解释是分母不同。总体指标的分母可能是全部已抓取链接,而某个分组的分母只是该分组内被工具识别到的链接。如果工具对某些来源识别率低,该分组的分母偏小,比例就会被放大或缩小,出现与总体相反的结论。
第二种解释是分组遗漏。分组时只保留了带某个标签的链接,把未标记、待确认或来源不明的链接排除在外。总体里这些链接占比很高,分组里却几乎为零,于是分组结论看起来与总体相反。此时问题不在计算,而在分组边界。
区分这两种解释的证据是:把被排除的链接单独拉出来,看它们是否集中在某个来源或某个时间点。如果被排除的链接大量落在同一来源,偏向“分组遗漏”;如果被排除的链接分散且各分组分母差异明显,偏向“分母不同”。
假设某外链检测工具显示总体有效链接比例为 60%,按来源分组后,论坛类有效链接比例只有 35%。此时先不要下结论说论坛外链质量差。查分母会发现:论坛类分组的分母只包含工具已识别的论坛链接,而总体分母还包含大量未分类链接。把未分类链接按来源重新归类后,论坛类比例可能回到接近总体的水平。这个假设说明的是排查方法,不是真实项目结果。
完成分母核对后,如果确认是分母口径不同,下一步应统一口径再出结论,而不是修改原始数据。如果确认是分组遗漏,下一步应补充分组规则,把遗漏链接纳入后重新计算。若两者都排除,才继续怀疑工具采集是否漏抓了某类页面。
需要提醒的是,第三方估算流量、搜索引擎报告与站内统计口径本来就不同。请求量、抓取量或某项统计归零,不能单独证明处理正确,它还可能来自过滤规则变化、时间窗口错位或数据延迟。把这些可能性列出来,比直接断定结论相反更有助于定位问题。
最后,把分母写进交付说明:每个分组的分母是什么,排除了什么,去重规则是什么。这样下次再出现分组与总体相反时,读者能直接判断是口径问题还是真实差异,而不必重新猜一遍。