在Statsig写的文章

数字营销归因模型:一份技术综述

原文:Digital marketing attribution models: A tech survey ↗

作者按:你会发现这篇文章里有很多公式。有公式,不代表模型就科学、就适用。这篇综述尽我所能客观地总结这些模型,我自己的看法会另外写文章发出来。

1. 数字渠道营销归因简史

早期的营销归因可以追溯到20世纪中叶的媒体组合模型(Media Mix Modeling,MMM),远在数字时代之前。MMM出现于20世纪50年代(到80年代才流行起来),是一种自上而下的方法:用汇总数据和统计回归,估计每个营销渠道对销售的贡献[1]。MMM能为预算分配提供宏观的参考,但缺乏后来数字营销人员需要的细粒度、用户级别和实时的细节。

随着互联网兴起,单触点归因模型成了标准做法。最后点击归因(last-click,也常叫last-touch)尤其流行,它把全部功劳给转化前的最后一个触点[1]。到21世纪初,Google Analytics这样的工具因为简单,默认使用最后点击模型。这种方法让营销人员能有效衡量直接响应类的渠道,却忽略了之前所有交互的影响。

后来,客户旅程越来越复杂,横跨多个渠道、多台设备和多次会话,于是出现了多触点归因模型,把功劳分给不止一次交互。早期的版本仍然是基于规则的(比如平均分配功劳,或者偏重第一次和最后一次触达)。它们比单触点模型好,但自带偏差,规则也是固定的,没法根据渠道之间的交互或相对重要性做调整[2]。

大约在2010到2012年,数据驱动的归因模型开始出现。研究人员和分析团队引入了算法方法(包括概率模型、马尔可夫链、逻辑回归和博弈论里的Shapley值),用真实的转化路径数据估计每个渠道的贡献[2, 3]。这些数据驱动的模型承诺能更准确地反映一个渠道的影响,因为它们依赖从数据里学到的规律,而不是预设的经验法则。

近几年,业界开始探索基于机器学习和AI的归因,包括循环神经网络、基于注意力机制的模型这类深度学习方法。它们想要捕捉长客户旅程里复杂的、非线性的交互[1, 3]。与此同时,增量(incrementality)和因果归因重新受到重视:用对照实验或高级的因果推断技术,试图分离出每个渠道真实带来的提升。总的来说,营销人员一直在寻求更准确、更能指导行动的洞察,想弄清数字触点怎样推动转化,营销归因也就一直在演进。

2. 主要的归因模型:基于规则的和数据驱动的

营销归因模型大体可以分成两类:基于规则的和数据驱动的。基于规则的模型用一条固定的经验法则分配转化功劳;数据驱动的模型则靠算法或实验从数据里学习。下面分别介绍每一类里的主要模型。


基于规则的归因模型

基于规则的模型容易实现、容易解释,但没法适应数据里特有的规律。它们按预先定好的位置或权重分配功劳,而不是从用户行为里学习。常见的有:首次触达、最后触达、线性、时间衰减、U型和W型。

首次触达归因(first-touch)

说明:首次触达(或首次点击)归因把一次转化100%的功劳都给用户旅程里的第一个营销触点[4],之后所有的交互都得零分。

用数学写,如果触点序列编号为 {1,2,…,n}\{1, 2, \ldots, n\},i=1i = 1 是第一个触点,功劳分配可以写成:

Credit(i)={1,i=10,其他 \text{Credit}(i) = \begin{cases} 1, & i = 1 \\ 0, & \text{其他} \end{cases}

第一个渠道基本上拿走了全部的转化价值(通常设为1,或者设为收入金额)。

适用场景和局限:首次触达适合用来识别把潜在客户第一次带到品牌面前的漏斗顶端渠道,能看出哪些活动最擅长制造认知或者带来初次互动。但它完全忽略了旅程中段和促成成交的交互,对漏斗长、流程复杂的业务尤其成问题[4]。

数学直觉:这个模型假设是旅程的发起者导致了转化,等于让第一次接触承担100%的责任。这可能过于简化了。

业界使用:首次触达没有最后触达那么流行,但在某些场景下仍然在用,常用来了解哪些渠道带来了新线索。大多数团队不会只靠它来分配预算。


最后触达归因(last-touch)

说明:最后触达(或最后点击)归因把100%的功劳都给用户旅程里的最后一个触点[4],之前的交互都得不到功劳。如果一个用户的路径是「自然流量 → 邮件 → 付费搜索 → 转化」,而付费搜索是转化前的最后一次点击,那付费搜索就拿走全部功劳。

形式上,如果 nn 是最后一个触点的编号:

Credit(i)={1,i=n0,其他 \text{Credit}(i) = \begin{cases} 1, & i = n \\ 0, & \text{其他} \end{cases}

适用场景和局限:最后触达简单直接,因为容易实现、容易解读,曾经是很多分析平台的默认模型[2]。它适合用来突出那些「促成」成交的漏斗底端手段。但它完全忽略了旅程早期的营销交互,常常低估那些带来初始认知和中段培育的渠道[5]。

数学直觉:它假设最后一次交互是决定性的,就像说接力赛里只有最后一棒配得上金牌。这是一条把相关当成因果的经验法则。

业界使用:因为简单,它在历史上一直是数字分析里最常用的归因模型。虽然很多平台(比如Google Analytics)已经转向数据驱动或多触点模型,最后点击仍然出现在很多效果报表里。


线性归因(linear)

说明:线性归因把转化的功劳平均分给序列里的所有触点[4]。如果转化之前一共有 NN 次交互,每次分到 1/N1/N 的功劳。比如一个用户的路径是「Facebook → 邮件 → 自然流量 → 转化」,每个渠道各得33.3%(假设一次转化的价值是1)。

适用场景和局限:当营销人员想要一个中立的、「每个触点都重要」的视角时,会用线性模型。它容易解释,也保证了不会忽略任何一次交互[4]。但现实中,所有触点的影响力很少是一样的。一次无关紧要的早期交互,可能和最后关键的临门一脚拿到同样的功劳。

数学直觉:功劳均匀分配:

Credit(i)=1N \text{Credit}(i) = \frac{1}{N}

其中 NN 是这段旅程里的触点数。这是一种简单化的「团队协作」观念,忽略了先后顺序和时间。

业界使用:各种分析工具里普遍都有,常被当作多触点模型的基线。营销人员有时把它和其他视角(比如最后触达、首次触达)放在一起比较,看按位置加权到底带来多大差别。


时间衰减归因(time decay)

说明:时间衰减归因给离转化近的触点更高的权重,假设越接近转化,影响越大。常见的实现是用指数衰减函数,半衰期通常是7天。在这个例子里,转化前7天的触点权重是转化当天触点的一半,转化前14天的是四分之一,以此类推。一个通用的公式是:

Crediti=12di/λ∑j=1N12dj/λ \text{Credit}_i = \frac{\dfrac{1}{2^{d_i / \lambda}}} {\displaystyle\sum_{j=1}^{N} \dfrac{1}{2^{d_j / \lambda}}}

其中 did_i 是触点 ii 发生在转化前多少天,λ\lambda 是半衰期(比如7天)。

适用场景和局限:如果你相信时间上的远近至关重要,时间衰减就很有吸引力,所以它在决策周期较长的场景里很常见[6]。缺点是半衰期怎么选有点随意,而且一次影响很大的早期交互,可能只是因为离转化日期太远就被低估了。

数学直觉:它建模的假设是影响力随时间递减,类似「记忆淡去」。比平均分配更贴近现实,但仍然是一条经验法则。

业界使用:Google Analytics的模型比较工具(Model Comparison Tool)等平台提供这个模型。想突出临近转化的触点、同时又给早期触点留一些功劳的营销人员常用它。


U型(基于位置)归因

说明:U型归因把大部分功劳分给第一个和最后一个触点,剩下的分给中间的触点[7]。常见的一种变体是:第一次交互40%,最后一次40%,中间所有触点分剩下的20%。如果没有中间的交互,第一个和最后一个各得50%。

适用场景和局限:如果营销人员认为最初的引入和最后的转化触发最重要、漏斗中段只起辅助作用,就会喜欢这个模型。它仍然依赖一个随意的权重(比如40/40/20),未必反映真实的重要性。如果漏斗中段的触点很多,每个可能只分到很小的一片。

数学直觉:功劳分布是「开头高、结尾高、中间低」,近似于一个强调获取线索和促成成交的漏斗。

业界使用:在Google Analytics或Adobe里有时叫「基于位置」(Position-Based)的归因。常见于B2B的漏斗,或者任何假定第一次和最后一次接触特别重要的场景。


W型归因

说明:W型模型是U型的扩展,突出三个关键点:首次触达、漏斗中段的一个关键里程碑,以及最后一次触达。比如首次交互得30%,中段事件(比如成为MQL,或者创建了销售机会)得30%,最后一次触达得30%,剩下的10%分给其他所有触点[7]。

适用场景和局限:主要用于有明确中段里程碑的B2B场景。主要的局限还是随意:它写死了一个假设,认为恰好是这三个点最重要,而这个假设准不准,要看具体的销售流程。

数学直觉:把三个关键时刻写死:初始线索、中段的关键里程碑、最终成交,其他的都淡化。

业界使用:在以线索为中心的B2B组织里很常见。除了那种周期长、按阶段推进的漏斗,W型就不太适用了。


数据驱动的归因模型

数据驱动的模型从历史数据或实验中学习,而不是套用一条固定规则,目的是更客观地揭示每个渠道对转化的贡献。下面是几种主要的方法:

  • 马尔可夫链归因
  • Shapley值归因
  • 算法/统计模型(比如逻辑回归、机器学习)
  • 增量测试和提升(lift)模型
  • 基于因果推断的多渠道归因
  • 基于客户旅程的深度学习模型

马尔可夫链归因

说明:马尔可夫链归因把用户旅程看作在各个渠道之间的状态转移,再加上「转化」和「未转化」两个吸收态[8]。它从数据里算出这些状态之间的转移概率,再用「移除效应」(removal effect)衡量每个渠道的重要性:去掉一个渠道之后,最终转化的总概率下降了多少,就代表这个渠道应得的功劳份额[8, 9]。

适用场景和好处:

  • 能捕捉旅程的先后顺序;
  • 用「如果去掉渠道X,会损失多少转化?」的逻辑解释结果,很直观;
  • 比任何单一位置的规则都更细致:主要出现在转化路径里的渠道会得到更多功劳。

局限:

  • 本质上仍然基于相关,证明不了因果;
  • 通常假设是一阶马尔可夫过程(除了当前状态之外没有记忆);
  • 尤其在数据有限、或者渠道经常同时出现的时候,最后可能把功劳比较「线性」地摊给很多渠道[9];
  • 单触点的旅程需要特殊处理(如果处理不当,模型可能错误地把这个渠道的部分功劳重新分给别的渠道)。

数学直觉:核心思想是比较有这个渠道和没有这个渠道时,马尔可夫链被吸收进「转化」状态的概率,以此算出每个渠道的增量效果。

业界使用:数据能力强的团队和一些归因服务商广泛采用。用开源库实现起来相对简单,很多人觉得它比僵硬的经验法则更贴近现实。


Shapley值归因

说明:Shapley值模型基于合作博弈论,把每个渠道看作参与「达成转化」这场博弈的一个「玩家」。一个渠道的Shapley值,是它在所有可能的渠道子集里提供的边际贡献的平均值[2, 10]。

用符号表示,对渠道 ii:

ϕi=1|𝒩|!∑R∈所有渠道的排列(v(PiR∪{i})−v(PiR)) \phi_i = \frac{1}{|\mathcal{N}|!} \sum_{R \,\in\, \text{所有渠道的排列}} \left( v\left(P_i^R \cup \{i\}\right) - v\left(P_i^R\right) \right)

其中 𝒩\mathcal{N} 是渠道的集合,RR 是一种排列,PiRP_i^R 是在这个排列里排在 ii 前面的渠道组成的子集,v(S)v(S) 是渠道集合 SS 带来的总转化数(或转化率)。

适用场景和好处:

  • 在博弈论意义上被认为是公平的,按实际贡献分配功劳;
  • 天然考虑了交互效应:如果两个渠道只有组合在一起才有价值,Shapley会把这份协同效应在两者之间分配。

局限:

  • 计算复杂度随渠道数量指数级增长,实际实现要靠抽样或近似[10];
  • 经典的Shapley值不考虑顺序(它基于集合,而不是序列),所以除非用扩展的方法,否则会漏掉时间上的细节;
  • 如果数据里有隐藏的偏差,它仍然容易把相关当成因果。

数学直觉:一个渠道的Shapley值,是它在所有可能的联盟情形下增量效果的平均值。

业界使用:被一些高级的归因方案采用。Google的Ads Data Hub有一个基于Shapley的分析选项,一些「数据驱动归因」产品也依赖类似Shapley的逻辑[10]。它被看作多触点功劳分配的一种稳健方法,不过计算量可能很大。


算法和统计归因模型(逻辑回归与机器学习)

说明:这类方法通常是训练一个分类模型(逻辑回归或更高级的机器学习模型),根据用户经历过哪些渠道或触点,预测这个用户会不会转化[11, 12]。然后用模型的系数或特征重要性,判断每个渠道对转化贡献了多少。

  • 逻辑回归:

log⁡(P(转化)1−P(转化))=β0+β1X1+⋯+βkXk \log \left( \frac{P(\text{转化})}{1 - P(\text{转化})} \right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k

其中 XiX_i 可以表示是否接触过渠道 ii。

  • 基于树的方法/集成方法:随机森林或梯度提升可以捕捉非线性的交互。归因时常用的方法有特征消融(「去掉渠道X,看预测的转化怎么变」)或者SHAP(一种基于模型、用Shapley思路计算特征重要性的方法)。

适用场景和好处:

  • 可以灵活地纳入各种特征(渠道类型、交互次数、用户属性等);
  • 如果模型正确地控制了其他因素,衡量「增量提升」就很直接;
  • 数据足够多时,预测能力很好。

局限:

  • 仍然是观察性的,可能有混杂;
  • 必须仔细设计特征;如果用的是较简单的方法,可能还要手动加交互项;
  • 一些机器学习方法是「黑箱」,除非你用可解释性技术。

数学直觉:模型 f(⋅)f(\cdot) 估计的是 P(转化∣渠道)P(\text{转化} \mid \text{渠道})。归因通常来自比较有某个渠道和没有这个渠道时 ff 的差别,或者分析学到的参数(逻辑回归里)或特征重要性(树集成里)。

业界使用:Google早期的数据驱动归因用的是一种bagged逻辑回归的方法[12]。Adobe的「算法归因」(Algorithmic Attribution)也用逻辑回归/计量经济学方法[11]。很多高水平的内部团队会用随机森林或XGBoost自己搭方案,尤其是当他们有大量用户级数据的时候。


增量测试和提升建模(lift modeling)

说明:增量测试通过实验直接衡量因果提升(比如用户级别的保留组,或者基于地域的测试)[13, 14]。随机地停投广告,或者在某些地区把广告关掉,就可以比较实验组和对照组的转化率。两者的差(也就是「提升」)就是这个渠道的增量效果。

适用场景和好处:

  • 因果的黄金标准:随机化避开了很多偏差;
  • 对品牌词付费搜索、再营销这类渠道尤其重要,因为观察数据可能把转化过度归功给它们;
  • 非常适合用来校准或验证其他归因模型。

局限:

  • 代价高:你得把真实的潜在客户或地区排除在营销之外,可能意味着损失收入;
  • 有些渠道(比如自然搜索或全国性的电视广告)很难随机化;
  • 结果只适用于被测试的预算和时间段,未必能完美推广。

数学直觉:就是实验组和对照组转化率之间直接的差:

Lift=P(转化∣实验组)−P(转化∣对照组) \text{Lift} = P(\text{转化} \mid \text{实验组}) - P(\text{转化} \mid \text{对照组})

再用统计推断(比如t检验、贝叶斯方法)确认这个差是显著的。

业界使用:Facebook、Google和Wayfair这样的大广告主,经常倡导或提供lift测试工具[13, 14]。很多成熟的营销团队都靠增量实验来确认一个渠道是否真的带来了净新增的转化。


用因果推断做多渠道归因(uplift建模与double ML)

说明:因果推断方法试图从观察数据里估计每个渠道的因果效应,同时校正混杂因素。

  • uplift建模:学习用户被「处理」(接触到某个渠道)和没被处理时,转化概率的差。常用的做法是给处理组和对照组分别建模,或者用专门的「元学习器」(T-learner、X-learner等)[15]。
  • 双重机器学习(Double Machine Learning,DML):用机器学习灵活地分别建模结果和处理分配,然后得到渠道的「去偏」效果[16]。

适用场景和好处:

  • 不需要持续地、全面地做实验,就能寻求因果效应;
  • 能识别出哪些细分人群真正从接触中受益;
  • 如果假设成立,可能比天真的基于相关的模型更准确。

局限:

  • 需要对未观察到的混杂因素做很强的假设,或者需要部分随机化;
  • 实现更复杂,结果可能对模型设定很敏感;
  • 把多个渠道当作多个「处理」,可能需要很大的数据集。

数学直觉:在uplift建模里,我们估计的是:

Uplift(x)=P(Y=1∣T=1,x)−P(Y=1∣T=0,x) \text{Uplift}(x) = P(Y = 1 \mid T = 1, x) - P(Y = 1 \mid T = 0, x)

其中 TT 是处理(是否接触某个渠道),xx 是用户的特征。double ML用partialling-out,也就是残差对残差回归的方法,去掉混杂的影响。

业界使用:较大的科技或零售公司里,高级分析团队对它的兴趣在增长。Microsoft的EconML库等工具实现了这些方法,但因为复杂,采用的还比较少。


基于客户旅程的深度学习模型

说明:深度学习方法用神经网络(RNN、LSTM、带注意力机制的Transformer)处理整条触点序列,预测是否转化[3, 17, 18]。然后用模型学到的参数(比如注意力权重),或者事后的可解释性方法(比如integrated gradients),得到归因分数。

适用场景和好处:

  • 有可能在不手动指定的情况下,捕捉渠道之间的非线性交互、时间规律和协同效应;
  • 注意力层提供了一种内置的机制,可以看到哪些触点最重要;
  • 在大规模数据的场景下,可能比简单模型表现更好。

局限:

  • 很吃数据,需要大量的用户旅程;
  • 从因果的角度看通常是个黑箱:预测更准,不代表归因就是因果上正确的;
  • 可解释性、训练的复杂度和过拟合的风险,仍然是挑战。

数学直觉:一个深度网络 ff 学习 P(转化∣触点序列)P(\text{转化} \mid \text{触点序列})。在基于注意力的模型里,每个触点 ii 会得到一个权重 αi\alpha_i,可以解读为这个触点对最终预测的贡献。

业界使用:目前更多出现在研究里,或者高度数据驱动的企业里(比如大型电商或广告技术公司)。大多数开箱即用的归因工具还没有把它作为标准功能,但随着AI方法成熟,它很可能会越来越受关注。


结论(如果你不质疑这些模型的前提的话)

数字营销归因已经走了很长的路:从简单化的经验法则(首次触达或最后触达),到更复杂的数据驱动方法(马尔可夫链、Shapley值),再往后。每个模型都从不同的角度回答哪些交互最重要、为什么重要。基于规则的方法因为简单清楚仍然流行,数据驱动的方法则试图学习并反映每个渠道真实的影响。

增量实验(lift测试)和因果推断模型,处理的是因果和相关这个核心挑战,正越来越成为高级营销分析的黄金标准。与此同时,深度学习承诺能捕捉多渠道旅程里丰富复杂的规律,但它往往缺少实验方法那样的因果保证。

没有哪一个模型是普遍「最好」的。成熟的组织通常会把多种方法结合起来或者互相比较,再用对照实验验证它们的假设。随着隐私政策的变化和新渠道的出现,归因的未来很可能是混合的方案:实时的统计和机器学习方法,加上定期的实验校准来引导。


参考文献

  1. Molloy, J. (2023). What Is Marketing Attribution? A Complete Guide. Corvidae.(归因的历史:从MMM到多触点再到AI)
  2. QueryClick (2021). A Comparison of Attribution Models: Shapley and Markov vs. Corvidae.(讨论简单模型的局限,介绍Shapley和马尔可夫)
  3. Zweig, J. (2023). Multi-Touch Attribution: From Traditional Models to Deep Learning Approaches.(涵盖最后点击、首次点击、线性的公式,并介绍LSTM和Transformer方法)
  4. Strong.io.(解释首次触达和最后触达)
  5. Adobe Blog (2017). Algorithmic Attribution: Choosing the Model Right for Your Company.(评论最后点击怎样忽略了更早的渠道交互)
  6. Workamajig. How To Choose A Proven Marketing Attribution Model.(介绍时间衰减里7天半衰期的做法)
  7. Dreamdata Documentation. Types of Attribution Models.(解释U型和W型的位置分配,比如U型的40-40-20和W型的30-30-30-10)
  8. ChannelMix (2021). Markov Chains for Marketers: A Quick-Start Guide.(介绍怎样为营销搭建马尔可夫链转移模型)
  9. Adequate Digital. Markov Chain Attribution Modeling [Complete Guide].(详细讨论马尔可夫模型的计算、偏差和陷阱)
  10. SegmentStream Blog. Marketing Attribution Models Explained.(概述Shapley值和博弈论的多触点归因)
  11. Adobe Blog (2017). Algorithmic Attribution: Choosing the Attribution Model That’s Right for Your Company.(介绍逻辑回归,即计量经济学建模)
  12. Shao, X. and Li, L. (2011). Data-Driven Multi-Touch Attribution Models. Google.(介绍bagged逻辑回归和条件概率的归因方法)
  13. Wayfair Tech Blog (2023). How Wayfair Uses Geo Experiments to Measure Incrementality.(解释用基于地域的保留组测试营销提升)
  14. Leavened (2023). Measuring Incremental Lift with Attribution Models.(定义增量提升,以及它和天真归因的区别)
  15. Mosca, A. (2023). Uplift Modeling: Predict the Causal Effect of Marketing Communications. Medium.(解释怎样在用户级别估计增量效果)
  16. Kögel, H. (2023). Causal Machine Learning in Marketing. Medium.(介绍用于无偏效应估计的双重机器学习)
  17. Li, N. et al. (2018). Deep Neural Net with Attention for Multi-channel Multi-touch Attribution. arXiv.(用注意力机制为序列里的每个触点归因)
  18. Strong.io Blog (2023). Modern Attribution Models: Deep Learning Approaches (LSTM & Transformer).(演示RNN和注意力怎样建模复杂的旅程)

这是Statsig博客英文原文的中文版。原文发表于2025年4月17日,中文版发布于2026年10月4日,图表来自原文。看全部19篇