1. 引言
A/B实验里占主导地位的,是传统的频率学派方法,特别是零假设显著性检验(null-hypothesis significance testing,NHST)。它有一些众所周知的问题:偷看中间结果(peeking)、误读p值、难以处理多重比较。贝叶斯方法则承诺提供更直观的「更好的概率」这类指标,以及更灵活的序贯监控。其中,带信息先验的贝叶斯方法(informed Bayesian)把关于效应大小的先验知识纳入进来,理论上可以加快决策,并把估计值收缩到更现实的范围。
这篇文章区分把「信息」带进贝叶斯A/B实验的两大类做法:
- 调整点估计:一种做法是指定一个先验,把后验的效应大小推向某个特定的假定,比如乐观或者怀疑。这样做可能是为了反映历史数据、领域经验或者其他外部知识。
- 收紧置信(可信)区间:另一种做法是选一个更窄的先验,降低后验分布的不确定性。这种做法可以和更严格控制错误率的方法(比如控制错误发现率FDR)对应起来,借助额外的知识让得到的区间更精确。
不过,尽管理论上很有吸引力,带信息先验的贝叶斯方法在实践中的落地方式五花八门,带来了一些实际的挑战。比如:
- 先验的选择会强烈影响后验估计,需要仔细校准,才不会无意中让分析跑偏;
- 更窄的先验虽然降低了不确定性,却可能需要更大的样本量或更长的实验周期。对依赖快速实验的组织来说,这些时间和资源上的要求可能相当可观;
- 它需要贝叶斯统计的专业能力,也需要把先验怎样选、怎样解读透明地沟通出来。这进一步说明,带信息先验的贝叶斯方法必须用得审慎,在纳入先验信息的好处和数据驱动决策的现实之间取得平衡。
所以在应用中,要警惕贝叶斯方法被误用,尤其是在还没弄清它会怎样被误用的时候:
- 两种带信息先验的做法,原则上都没有「错」。但第一种带来了更大的数据操纵风险,第二种则可能拖慢决策。
- 很多情况下,第二种做法实际上等价于频率学派的FDR类校正,结果往往也一样,只是换成了贝叶斯的说法。
- 从组织的角度看,真正的危险在于,「贝叶斯」这个标签可能被用来掩饰对数据分析过程的操纵,或者带来不必要的负担,让团队不愿意做实验。
我们的目标是把这些取舍讲清楚,并提出负责任地使用贝叶斯方法的路子。为此,我们推荐两种做法:
- 我们(Statsig)很快会在产品里推出带信息先验的贝叶斯方法,作为一个高级工具,并为负责整个实验项目健康度的卓越中心(center of excellence)团队提供权限控制。请谨慎使用。
- 采用Tom Cunningham的做法:报告原始估计值、基准统计量(benchmark statistics),以及每个实验特有的细节。
正如Tom在他的文章里说的:
基准(benchmarking)解决了上面所有的问题(从观察到的效应推断真实效应)。用经验贝叶斯收缩之后的估计值,代表的是:在「这个实验是从某个给定的参照类别里抽出来的」这个条件下,我们对真实处理效应的最佳猜测。
2. 文献回顾
2.1 A/B实验里的贝叶斯和频率学派方法
频率学派的NHST用p值检查观察到的数据是否显著偏离原假设。p值低于α=0.05,被广泛当作实验组优于对照组的证据。但这类检验容易被误用:提前停止(偷看)会抬高第一类错误;p值也可能被误读成「假设为真的概率」。
贝叶斯方法则是根据观察到的数据,把先验分布更新成后验分布。然后就可以算出处理效应为正、为负或者超过某个阈值的概率。在一定条件下,它对中途查看结果的处理更从容。但关键是,一旦引入「带信息的」(也就是非均匀的)先验,贝叶斯的结果就可能随先验的设定,被推向显著或者推离显著。
2.2 两类带信息先验的贝叶斯调整
做法一:移动点估计
可能的好处
- 纳入现实的预期:如果有可靠的历史数据或领域经验作依据,一个移动点估计的先验可以反映关于典型效应大小的真实知识。如果历史上大多数改动带来的提升都在2%左右,把这一点写进先验,就能避免对随机波动反应过度。
- 更快收敛到真实效应:如果先验校准得好,后验可能用更少的样本就识别出真正有益的版本。这能让产品团队更早地上线有意义的改进,可能带来竞争优势。
- 在临界情况下有更好的功效:当效应很小但真实存在时,一个以那附近为中心的信息先验,可以帮助检测到这些细微的改进;如果用纯粹无信息的方法,可能需要非常大的样本量。
实际的风险
- 披着科学外衣的数据操纵:如果一位高层合作方要求用一个偏向实验组的强先验,团队可能不知不觉地「证实」了一个大家想要的结果。这种做法在功能上和「α膨胀」差不多,只是藏在了贝叶斯的术语后面。
- 有偏的采纳:过于乐观的先验可能把临界的后验抬高,导致产品团队上线一些不够好的改动,损害长期结果。如果组织没有正式的流程来论证或审计先验,这个风险会被放大。
做法二:限制或收紧置信(可信)区间
可能的好处
- 更强的错误控制:通过收窄可能效应的范围,这种做法可以减少假阳性。本质上,它提高了「效应很大」这类说法需要的举证门槛,让结果更不容易被随机噪音带偏。
- 和经验贝叶斯或FDR框架一致:一个仔细调过的先验,可以近似频率学派的错误控制方法,比如FDR校正。对已经熟悉FDR的组织来说,一个对应的贝叶斯版本能提供更直观的「改进的概率」这种解读,同时保持严格的门槛。
- 减少对极端结果的过度自信:紧的先验自然会收缩估计值,防止团队对一闪而过的尖峰或短期异常反应过度。当同时测试多个版本、其中很多结果都接近中性时,这种「收缩」往往是有益的。
实际的风险
- 常常和FDR重复:如果一个组织已经在用Benjamini–Hochberg这类频率学派方法,贝叶斯的收紧区间做法可能就是重复劳动。除非大家强烈偏好贝叶斯的解读,否则增加的复杂度未必带来新的好处。
- 拖慢决策:窄的区间或者高的后验门槛,通常需要更大的样本量才能得到确定的证据,尤其是当先验对大效应惩罚很重的时候。这会推迟上线,让大家不愿意频繁做实验,可能损害数据驱动的文化。
3. 示例
3.1 业界正确的应用
- 基于历史数据的经验贝叶斯先验:Microsoft Bing等组织的大规模实验表明,用历史效应大小的分布来建模先验,可以在假阳性和假阴性之间取得平衡。把先验的中心放在「大多数功能带来的提升都很小或接近于零」上,贝叶斯方法就会变得保守,不太容易夸大正向效应。
- 针对子人群的分层模型:当实验横跨多个地区或产品线时,分层贝叶斯方法可以在各个子群之间「借力」(borrow strength)。这是做法二(限制区间)的典型例子:每个子群的后验都会被部分地拉向整体的效应大小,减少小样本噪音带来的错误发现。
- 结构化地设定先验:有些受监管的场景,比如临床试验,要求在看到任何数据之前就严格地指定先验。同样,一些大科技公司也把先验必须怎样设定、怎样验证写成了规则,压缩了投机性调整的空间。
3.2 业界不当的应用
- 有影响力的合作方指定先验(做法一的滥用):假设一位VP想推动某个功能上线,坚持说一个公认的「行业最佳实践」至少能带来3%的提升,于是得到一个人为地扭曲后验的先验。证实这个预期的压力,可能会掩盖掉微弱的效应甚至零效应。
- 过度谨慎,实验变慢(做法二的滥用):过紧的先验,或者判定「赢了」的贝叶斯门槛太高,会让真正有效的改进长时间停留在「没有定论」的状态。团队可能失去势头,或者干脆回到凭「感觉」上线功能,而不是凭数据。
4. 把做法二和其他方法做比较
频率学派的FDR控制
Benjamini–Hochberg这类频率学派程序,会明确地调整p值的门槛,把假阳性的比例控制在目标以下。经验贝叶斯的数学往往和基于FDR的逻辑如出一辙,这说明一个实现得好的做法二贝叶斯方法,在功能上等价于一条做了FDR校正的频率学派分析流程。所以,真正的选择可能取决于解读上的偏好、组织的熟悉程度,以及手头有什么软件工具。
序贯/自适应的频率学派方法
「始终有效」(always-valid)的p值或序贯p值,解决的是同样的提前停止问题,而且不需要主观的先验。对依赖不确定的「专家知识」心存顾虑的团队,可能更喜欢这些纯频率学派的方案,推断过程更透明。
5. 回应几种反对意见
「不移动点估计,就是在忽视先验知识。」正当的知识确实应该进入分析,但它必须经过实证检验,而不是靠讲故事或者领导拍板。用真实的历史数据搭一条稳健的经验贝叶斯流程,通常比手动注入一个乐观的均值安全得多。
关于怎样把实验观察到的效应校准成真实效应,Tom Cunningham有一套很完整的论证。在比较了多种选择之后,他的建议是报告效应时附上「基准统计量」,我们同意这一点。
「紧的贝叶斯区间更科学、更严谨,所以不会有坏处。」如果每个实验都因此需要多得多的参与者或时间才能达到显著,它就可能在无意中伤害实验文化。组织必须在科学上的审慎和对可行动结果的需要之间取得平衡。过窄的先验或过高的贝叶斯门槛,可能产生寒蝉效应,让团队不愿意做实验。
「极端的先验操纵,我们肯定看得出来。」大的操纵也许很明显,但小的偏差会累积。团队可能把先验微调好几次,把临界的情况推过线。没有透明的流程,这些偏移可能一直不被发现。
6. 可执行的建议
为了降低两种带信息先验的贝叶斯做法的风险:
- (可行时)采用基于历史数据的经验贝叶斯:用过去真实的实验来构建先验。这能遏制个人偏见(做法一的滥用),也为控制方差提供了诚实的依据(做法二)。
- 专家先验要在看数据之前正式定下来:如果领域专家确实有知识,在看到实验结果之前就把它详细地记录下来,并请独立的评审签字确认分布假设。
- 校准和模拟:不管是移动点估计还是收紧区间,都要在现实的效应大小下做模拟,确认你的假阳性率和假阴性率仍然可以接受。
- 保持透明:始终公开先验的参数,以及后验结果和频率学派指标(比如p值)比起来如何。这有助于发现可疑的模式,或者借贝叶斯做手脚的「Bayesian hacking」。
- 把频率学派的FDR或always-valid方法当作补充:如果你已经有一条稳健的FDR校正p值流程,再加一个类似的贝叶斯版本可能就是多余的。反过来,对主观先验不放心的团队,可能更喜欢纯频率学派的序贯设计。
- 守护实验文化:追踪基于先验的分析被用了多少次,以及其中有多少次带来了新的决策。如果结果全是「没有定论」,或者「正向」得可疑,那这个流程可能正在扼杀创新,或者在鼓励操纵先验。
如果你想找一个最科学、最现实、最稳健的做法,我们推荐Tom的做法:报告原始估计值,同时附上基准统计量和每个实验特有的细节,然后让决策者来拍板。
7. 结论
在工业界的A/B实验里,带信息先验的贝叶斯方法提供了两个主要的杠杆:(1)用先验移动效应大小的估计值;(2)收窄(或限制)可信区间。两种做法在理论上都站得住,但在实践中各有不同的取舍。
移动点估计(做法一),如果组织拿它来验证一个想要的结果,就很危险。一个强先验,尤其是由高层合作方指定的强先验,可能抬高假阳性,掩盖微弱的效应或零效应。收窄区间(做法二)则很符合控制错误发现的精神,但在实践中可能和频率学派的FDR校正如出一辙。它也可能把实验拖慢到团队失去频繁做实验的兴趣,损害整体的实验文化。
归根结底,问题不在于贝叶斯方法是好是坏,而在于它怎样落地、怎样被治理。经验贝叶斯流程、透明的报告、模拟,以及激励的对齐,都能减轻两种带信息先验的贝叶斯做法的弊端。把这些保障放在优先位置,数据科学团队就能享受贝叶斯推断的好处:清晰、灵活、有原则地纳入先验知识,同时不牺牲实验文化的速度和诚信。
这是Statsig博客英文原文的中文版。原文发表于2025年3月13日,中文版发布于2026年10月4日,图表来自原文。看全部19篇