终止条件要在试验开始前写死,核心是三条线:一条证明试验页有效、值得推广,一条证明无效、应当退出,一条证明结果无法解释、必须暂停。三条线都要绑定可核对的指标和观察窗口,而不是凭感觉决定继续或收手。试验页与全站之间存在量级、结构和需求差异,所以推广决策不能只看试验页涨没涨,还要看涨的部分能否被解释、能否在全站复制。
试验页跑完后,结果通常落在三类里,每类对应不同动作。
把这三类提前写成判定规则,推广时才有依据。规则里要写明:看哪个指标、看多长窗口、达到什么程度算通过、低于什么程度算退出。
常见的错误是把终止条件设成“观察两周再说”。两周到了,数据没结论,人却倾向于默认继续,等于没有终止条件。更稳的做法是把条件写成“指标 + 窗口 + 阈值”的组合。
假设一个场景:某类栏目页统一调整了正文首段的回答方式。可以预先设定,观察窗口覆盖至少一个完整的需求周期,比较对象是未改动的同类页面,而不是自己改前的绝对数值。通过线可以设为:改动组相对对照组的点击率或停留表现稳定优于对照,且差异在窗口内持续出现。退出线可以设为:改动组持续弱于对照,且没有其他解释能说明原因。中间地带则触发暂停,先查数据采集是否一致、需求是否发生季节性变化。
这里的关键是阈值要落在能区分信号与噪声的位置。如果正常波动本身就能吞掉你设的阈值,那这条线就是摆设。可以先看历史数据里同类指标的日常波动范围,再把阈值设在波动范围之外。
试验页表现变差,不一定说明方案错。反过来,表现变好,也不一定说明方案对。至少有以下几种解释需要分开核对。
区分这几种解释,靠的是对照组和一致性检查,而不是反复看试验页自己的曲线。如果只有试验页在动、对照组平稳,第一种和第三种解释更可能成立;如果两组同向移动,第二种解释更可能成立;如果连未改动页面都异常,先查第四种。
即使试验页通过,也不建议直接全站应用。更稳的路径是按页面类型分批推广,每批都保留对照,每批都复用同一套终止条件。
具体动作可以这样安排:先把试验页所属的页面类型作为第一批,推广后按预设窗口复核;通过后再进入结构相近的第二类页面;与试验页差异大的页面类型单独评估,必要时重新做小范围试验。每一批的结果都会影响下一批的范围——如果第一批通过而第二批明显走弱,说明方案有适用边界,应当缩小推广范围,而不是硬推。
这样做的好处是,终止条件在每一批都能被检验,而不是只在最初那一次生效。推广范围本身也成了可调整的变量。
开始推广前,把下面几项落到纸面,能显著减少事后解释的空间。
假设一个短例子说明取舍:某方案在试验页上点击表现略好,但差异落在历史波动范围内,且对照组同期也在上升。按预设规则,这属于方向不明,应触发暂停而不是推广。暂停后延长窗口再比较,如果差异仍然不超出波动,就按退出处理;如果差异稳定拉开,再进入第一批推广。这个判断过程不依赖对方案的好恶,只依赖事先写好的线。
最后要注意,一次改动前后的比较必须考虑季节、搜索需求变化和数据采集差异,这些因素足以让同一方案在不同时间得出相反结论。终止条件的意义,就是把这些干扰因素提前纳入判断,而不是等结果出来再补解释。