我们经常陷在统计的技术细节里,忘了更大的图景。
一个常见的困惑,也是一个经常吵得很凶的话题,就是贝叶斯(Bayesian)和频率学派(Frequentist)两种方法的区别。
这场争论听起来像是根本立场的冲突,但很多时候,它争的是我们怎样谈论不确定性,而不是我们根据数据实际做出的决策。
下面我们重点讲讲,为什么这些差别往往没有某些人说的那么重要。
核心的困惑:「90%的概率」到底是什么意思?
假设你想知道你所在城市成年人的平均身高。你收集了一些数据,算出一个可能取值的范围。
- 频率学派会说:「我们算出的90%置信区间是5英尺6英寸到5英尺9英寸(约168到175厘米)。」这听起来像是说,真实平均身高有90%的概率落在这个范围里,对吧?不完全对。
- 贝叶斯学派会说:「我们算出的90%可信区间是5英尺6英寸到5英尺9英寸。」这句话确实意味着,根据他们的模型,真实平均身高有90%的概率落在这个范围里。
那谁对?答案出奇地简单:在各自的框架里,都对。区别在于两派怎样看待「未知的平均身高」这件事,以及「概率」代表什么。
像频率学派那样想:一切都关于程序
频率学派用重复实验的眼光看世界。可以这样理解:
- 未知量是固定的:你分析数据的时候,城市成年人的真实平均身高并不会变。它是一个固定的数,只是我们不知道。
- 随机性在数据里:随机性来自你恰好抽到了哪些人。如果你把调查重复做很多次,每次的结果都会略有不同。
- 置信区间讲的是重复:90%置信区间的意思是,如果你把整个过程(收集数据、计算区间)重复很多次,其中90%的区间会包含真实的平均身高。
像贝叶斯学派那样想:一切都关于信念
贝叶斯学派的做法不同。他们把未知的平均身高看作一个可以有概率分布的东西。
- 未知量是不确定的:在看到任何数据之前,你可能对平均身高有一个初始的信念,也就是「先验」(prior)。比如你觉得大概在5英尺7英寸(约170厘米)左右,但不太确定。
- 数据更新信念:你收集到的数据会更新这个先验信念,得到一个「后验」(posterior)分布。后验代表你更新之后对平均身高的理解。
- 可信区间讲的是概率:90%可信区间的意思是,(根据你的模型和数据)真实平均身高有90%的概率落在这个范围里。
为什么两种哲学看起来是冲突的
核心区别在这里:
- 频率学派:关注事件长期发生的频率。概率说的是,如果把实验重复很多次,某件事会多常发生。
- 贝叶斯学派:关注对一个未知量的相信程度或确定程度。概率衡量的是,在你现有的知识下,某件事有多大可能。
这些区别在实践中真的重要吗?
出人意料的是:很多时候,没你想的那么重要!
- 大样本:数据很多的时候,贝叶斯和频率学派的结果往往非常接近。在贝叶斯方法里,数据会压倒任何先验信念。
- 无信息先验:如果贝叶斯用的是「平坦」的或者「无信息」的先验(也就是没有很强的初始信念),结果往往和频率学派的方法非常接近。
- 现实中的决策:假设你在测试一个网站的两个版本(A/B实验)。
- 频率学派会看转化率之差的95%置信区间是否不包含0;
- 贝叶斯学派会看转化率之差的95%可信区间是否完全在0以上;
- 在大多数情况下,两者对哪个版本更好会得出同样的结论。
关于带信息性先验的贝叶斯
带信息性先验(informative prior)的贝叶斯方法,是少数几个会让不同方法导向不同决策、不同业务结果的地方之一。理论上,它有几个好处:
- 决策更快、更准;
- 能利用过去的信息;
- 提供了一种结构化的方式,去讨论背后的假设。
因为这些好处,有人主张采用它,包括Amazon和Netflix这些公司的数据科学家(参考)。
但在实践中,带信息性先验的贝叶斯方法可能有风险。因为委托代理问题,以及大家普遍偏爱正向结果,它可能被滥用来操纵实验结果,同时还维持着科学严谨的样子。一个手法熟练的数据科学家拿着这个方法,几乎可以变出任何想要的结果。我和Kenneth Huang博士的对谈从数学和实践两个角度讨论了这些风险。
我们(Statsig)计划很快推出带信息性先验的贝叶斯方法,但同时也会提供监督的工具,比如让实验团队(例如卓越中心,center of excellence)可以强制要求先验必须有纪律、有依据。功能上线时我们会发一篇更详细的文章。在这里,我想提醒大家:在仔细想清楚它的次生影响之前,不要用这个方法。
结论:区别更多在于「解读」
- 频率学派的置信区间:告诉你的是你所用方法的长期表现。它不对某一个具体区间做概率上的陈述。
- 贝叶斯的可信区间:让你可以根据模型和数据,直接对未知参数做概率上的陈述。
两种方法都成立,也都有用。怎么选,通常取决于:
- 你对先验的接受程度:你愿意把先验信念放进分析里吗?
- 你想怎样沟通:你更喜欢谈长期频率,还是直接谈概率?
- 你所在领域的惯例:有些领域有很强的传统,偏好其中一种方法。
- 风险承受度:如果上线的成本低,或者上线一个坏东西的风险低,贝叶斯就很合适,因为比起只在p<0.05时才上线,你会更快地朝正确的方向走。
说到底,贝叶斯和频率学派之争,主要是哲学上的。解读不同,实际的影响往往很小。
贝叶斯并没有引入任何新的信息。两种方法看到的,都是各个实验组的均值和标准差。重要的是理解每种方法背后的假设,选一个最适合你具体情况和沟通目的的方法。如果你拿不准,我有两条具体的建议:
- 用频率学派,图个简单,减少沟通成本。
- 不管用哪种方法,都把你的决策当作一次下注。领导常常要在不确定中做决定。数据科学家的工作,是估计风险和概率,然后给出建议。决策的质量才是最重要的。
别被这场「战争」拖住。理解理论上的争论,但把注意力放在业务结果上。
这是Statsig博客英文原文的中文版。原文发表于2025年2月11日,中文版发布于2026年10月4日,图表来自原文。看全部19篇