在Statsig写的文章

为什么说A/B实验最终是定性的

原文:Why A/B testing is ultimately qualitative ↗

对数据驱动的团队来说,A/B实验必不可少。但它真正的价值不只在指标本身,而在于这些指标帮你做出的决策,而这些决策最终是定性的。

看到更大的图景

现实中的决策,不是在统计的真空里做出来的。一群视角各不相同的人坐在一个房间里讨论各种选项,在多个目标之间权衡利弊,这些目标有时还相互冲突,而且很多都没法用一个指标来衡量。

对数据科学家来说,这意味着眼光不能只停在p值或效应大小上。没错,你确实要保证结果在统计上站得住;但你也得问自己:「这里还有什么别的事情在发生?」不管是品牌上的考虑、用户信任,还是和更大的业务目标是否一致,这些定性的维度,和A/B实验结果一样需要放在一起考虑。

数据的局限,和专业判断的作用

Tom Cunningham有一个很有名的说法:数据科学有两个挑战,推断和外推。推断比较直接,看一个实验版本在特定条件下是否比对照组表现更好就行。但把这些洞察外推到更大的问题上(比如不同的场景,或者用户群发生了变化),往往需要一定程度的定性推理。再好的定量模型,也没法顾及每一个细微之处。没有哪个实验能衡量一切。

还要记住,早在现代实验方法出现之前,组织就一直在创新。正如Tom说的:「人们建起大教堂、设计出飞机、做出风靡全球的app,靠的不过是领域经验、直觉和常识。」这不是说实验和严谨不重要,而是说,在实践中练出来的定性判断,仍然至关重要。

平衡的做法:数字加上叙事

那最好的做法是什么?作为数据科学家,我们最有说服力的工作,往往是把定量的严谨和定性的智慧结合起来:

  • 从目的出发:没有想清楚的假设,就别跑实验。不要只想哪些指标会动,还要想它们为什么会动。
  • 给出清楚的数据,但强调上下文:先用效应大小、置信区间、统计显著性这些定量指标,把结果直白地讲出来。然后再补上定性的细节:为什么会这样,可能有哪些坑,这个效应和更大的业务目标是否一致。
  • 欢迎更广泛的反馈:听听那些可能有非定量洞察的合作方的意见。他们也许会发现算法和看板漏掉的因素。
  • 把决策当作取舍来讨论:A/B实验常常显示,一个指标的收益是以另一个指标的损失为代价的。哪些取舍最重要,要引入定性的判断。

最终的目标

说到底,实验不是学术练习,而是为了支撑那些能带来真实结果的决策。在一个复杂的世界里,光靠数据没法揭示每一个细节。最终,最好的决策,是把扎实的数据和有经验支撑的深思熟虑的解读编织在一起。

学会说两种语言,定量的和定性的,这样的数据科学家,在任何实验驱动的文化里都是不可或缺的合作伙伴。重要的不只是你能衡量什么,还有这些衡量结果怎样放进组织决策的大图景里。

这是Statsig博客英文原文的中文版。原文发表于2025年4月9日,中文版发布于2026年10月4日,图表来自原文。看全部19篇