前面几章讲的是增长分析的基本功:理解用户行为,衡量参与度,做实验、分析结果,找机会,建可靠的指标,用数据做决定。
这一章转向两个更专门的话题。产品成熟以后,有经验的增长分析师一定会碰到它们:性能和飞轮。它们建立在前面的基础上,但关注的是具体的杠杆和机制。基本的增长框架搭好以后,这些杠杆对产品的影响会非常大。
被低估的性能
点一个按钮,然后等,等,再等。很多人都有过这种烦躁。性能,也就是产品响应用户操作的速度,可以直接决定用户体验的好坏。不管是打开app、刷新页面,还是简单地打字,每一毫秒都影响用户愿不愿意继续用、满不满意。
性能(performance)和可靠性(reliability)常被混为一谈,其实是两回事。性能像一辆车开得多快,可靠性是这辆车能不能发动。可靠性关心产品能不能正常工作:会不会崩溃?有没有响应?性能关心的是响应有多快。
用「完成某件事要多久」这类指标衡量性能时,重点不是中位数,而是P90或P95,也就是最慢的那10%或5%的体验。为什么盯着这些极端情况?因为大多数用户可能都满意,但碰上慢的那些人,最可能放弃产品。把这些最慢的情况改善了,不但能留住高风险的用户,往往也会让所有人的体验变好。
看一个典型的网页加载时间分布。它明显向右偏:大部分加载很快,但有一条长长的尾巴。
假设你是一个正在赶着上线产品的创业者。性能优化看起来是你现在负担不起的奢侈品,你需要的是一个能用、用户喜欢的产品。这在科技行业很普遍:早期,性能往往排在后面。可一旦产品有了起色,同样的性能,就可能成为强大的增长动力。
怎么说服团队在性能上投入?有两种基于数据的办法。
探索分析。深入用户日志,找出速度和产品成败之间的关系。具体做法是:把用户留存对性能做逻辑回归,同时控制app类型、国家、网速这些变量。
- 按app类型、国家和团队规模,画出性能的分布规律;
- 用严谨的统计分析,找出速度和留存之间的关系。
反向实验。有时候,证明性能有价值的最好办法,是暂时把它拿走。做一个A/B/n实验,同时测试几种不同程度的人为减速,比如分别慢100毫秒、300毫秒和500毫秒,看用户的反应。这样能直接测出速度对用户满意度的影响。
关键在于:不是所有的慢,对用户的影响都一样。复制一个很大的模板,用户愿意耐心等;页面加载慢,用户很快就没耐心了。说到底是预期管理。
要把力气花在最值得的地方:
- 最重要的操作:用户每天都依赖的核心功能,比如编辑文档。要同时考虑参与度和使用频率。
- 最重要的界面:把它们当成你的门面,比如官网、通知和导航。第一印象很关键。
- 最重要的场景:不同的场景对速度的要求不同,比如一个人编辑和多人协作,就要分开对待。
做成这件事,要靠数据分析师和工程师配合。分析师找规律,工程师保证测的是对的东西:测用户实际感受到的体验,而不是后端的处理时间。
最后一块拼图是定清楚目标。画一条「放弃曲线」,看加载越慢,有多少用户放弃,就能找出不同地区和设备上的关键门槛。
数据呈现出很清楚的规律:一开始只有零星的人放弃;超过3到5秒这个关键门槛后,放弃的人急剧增加;最后稳定在90%左右。记住两个数:3秒,是用户开始流失的临界点;50%的放弃率,是很难挽回的分界线。
接下来用A/B测试来验证。你把app的加载时间优化好了,怎么证明它的效果?标准的A/B测试方法(第十章会详细讲)是很好的基础,但性能指标有它特殊的地方。分析P90、P95这样的百分位数时,传统的t检验可能不够用。就像要比较一个房间里最高的人有多高,平均身高说明不了问题。
这时候需要专门的统计工具。百分位数不是均值,标准t检验的前提不直接成立,常见的做法是用bootstrap,或者专门推导的方差公式。另外,实验通常按用户随机分组,加载时间却是按每次加载记录的,一个用户会有很多次加载,算方差时也要考虑这一点。包括Wish在内的几家公司,在百分位数的A/B测试上做了很好的探索,可以读Qike (Max) Li的文章《How Wish A/B Tests Percentiles》。1
飞轮效应:把小胜利变成停不下来的势头
想象你在推一个巨大的轮子。一开始它几乎不动,每推一下都很费劲。但只要一直推下去,轮子会越转越轻松,每转一圈都更快。这就是飞轮:一种把断断续续的力,转化成稳定持续动力的机械装置。
在商业上,吉姆·柯林斯(Jim Collins)在《从优秀到卓越》(Good to Great)里讲过这个概念。物理的飞轮把不规律的推力变成平稳的转动;商业的飞轮,把一个个小而持续的行动,变成停不下来的势头。每一个客户的成功、每一次产品改进、每一次好的互动,都在给飞轮加速,让未来的增长越来越省力。
对数据科学家来说,飞轮不只是一个比喻,而是一个衡量和推动可持续增长的框架。你的任务是和产品团队一起,找出、衡量并优化自己产品的飞轮。
每个产品的飞轮都不一样。交易平台的飞轮,是买家和卖家互相为对方创造价值;内容平台的飞轮,是创作者和消费者之间的良性循环:好内容吸引更多投入的用户,又激励创作者做出更多好内容。下面看一个具体的例子。
这就是创作者飞轮,一个自我强化的循环。它这样运转:创作者发布独特的内容,丰富了平台的内容库;推荐算法通过个性化的信息流,把内容送到合适的观众面前;用户看到喜欢的内容,就会评论、点赞,形成活跃的社区讨论;这些互动激励创作者回应观众,做出更好的内容,循环就闭合了,而且越转越强。
要发挥飞轮的作用,就要定期检查它的各项体征。定义和追踪这些指标,是数据科学家的重要工作。对创作者飞轮,可以用这几个指标判断势头是不是在积累:
- 内容生产:每个创作者发了多少内容、多频繁,这是平台的命脉。
- 内容库存:有多少高质量、相关的内容可以推给用户,衡量内容生态的多样和深度。
- 曝光:通过观看次数和互动率,衡量内容的触达和分发效果。
- 反馈:从简单的点赞到认真的评论,量化用户的互动,衡量社区有没有活力。
- 创作者互动:创作者回应观众的速度和程度,衡量社区的健康。
密切追踪这些指标,就能发现早期的预警信号,及时肯定做得好的地方,用数据做决定,让飞轮保持在最好的速度。这就是你的增长仪表盘,每个指标都反映平台的势头和潜力。
搭建增长飞轮:一个分步框架
打造一个有力的飞轮,不只是画几个圈和箭头,而是要设计一个能自我强化、推动可持续增长的系统。下面是搭建和衡量飞轮的完整步骤。
1. 打好地基
- 找出驱动产品成功的核心要素,包括获客和参与的循环;
- 把这些要素之间的因果关系理清楚。比如,看参与度提高怎样带来更多的口碑增长。
2. 划分阶段
- 把飞轮分成几个清楚、能落到行动上的阶段,首尾相连形成循环,每一个环节都增强下一个;
- 确保每个阶段自然地产生动力,推动下一个阶段。
3. 衡量真正重要的东西
每个阶段都要有能准确反映表现的指标,重点看这几块:
- 内容生产:新内容的质量和数量;
- 内容分发:触达和互动指标;
- 用户互动:互动的深度和频率;
- 社区增长:网络效应和病毒系数;
- 创作者的成功:创作者的留存和满意度。
4. 监测势头
- 建立可靠的追踪系统,实时掌握飞轮的状态;
- 用时间序列分析找规律、预测趋势、发现早期预警;
- 设定合理的报警阈值,在小问题变成大障碍之前处理掉。
5. 优化加速
- 针对每个阶段做有针对性的实验。比如测试不同的内容推荐算法,看哪个更能提高互动;
- 找出并清除拖慢飞轮的摩擦点。
6. 对齐战略目标
- 确保飞轮直接支撑公司的北极星指标和业务目标;
- 做清楚透明的报告,说明飞轮对业务的影响。
7. 持续演进
- 产品和市场在变,飞轮也要定期重新评估和调整;
- 衡量体系要灵活,新机会出现时能及时跟上。
8. 用自动化提效
- 搭建可靠的数据基础设施,自动收集关键指标并做成可视化;
- 用智能监控系统,提前发现和处理潜在的问题。
有效的飞轮靠的是数据和持续优化,不是希望和假设。落实这些策略时,要一直盯着实际的效果,根据真实的结果迭代。飞轮不该只是一张漂亮的图,而是一台每转一圈都更强的增长引擎。
本章要点
这一章讲了增长分析里两个更专门的话题:性能和飞轮。
- 性能分析:看P90/P95,不只看平均数;和工程团队一起保证计时准确;用放弃曲线定出有意义的性能目标。
- 飞轮框架:理解并落实飞轮,是可持续增长的关键。要找出、衡量并优化每个产品自己的飞轮。
- 用数据驱动:做好性能优化和飞轮,需要:
- 定期监测关键指标;
- 持续实验和优化;
- 和业务目标清楚地对齐;
- 随着产品演进不断调整。
练习
你是一个视频流媒体平台的增长分析师,最近发现用户参与度有一些令人担心的趋势。
第一部分:性能分析
视频加载时间的数据如下:
| 百分位 | 加载时间 |
|---|---|
| P50 | 2.1秒 |
| P90 | 4.8秒 |
| P95 | 6.2秒 |
不同加载时间下的用户留存:
| 加载时间 | 留存率 |
|---|---|
| 0到2秒 | 85% |
| 2到4秒 | 72% |
| 4到6秒 | 45% |
| 6到8秒 | 28% |
| 8秒以上 | 12% |
问题:
- 为什么在这个例子里,要关注P90/P95,而不是中位数(P50)?
- 根据留存数据,你会把加载时间的关键门槛定在多少?
- 如果能把所有P90的体验都改善到4秒以内,整体留存可能提高多少?
参考答案:
问题1:P90/P95反映的是最差的那些体验,它们对留存的影响不成比例地大。P50只说明一般情况,而真正把用户赶走的,往往是那些很慢的极端情况。这个例子里,中位数2.1秒落在72%的留存区间,看起来没问题;可P90的4.8秒和P95的6.2秒,分别落在45%和28%的区间。
问题2:把门槛定在4秒,因为:
- 过了4秒,留存从72%骤降到45%;
- 这和行业里常说的3到5秒门槛一致;
- 这是一个技术上现实的目标。
问题3:粗略的算法是:
- 现在的P90是4.8秒,落在4到6秒的区间,留存45%;
- 改善到4秒以内,进入2到4秒的区间,留存72%;
- 最慢的10%体验,留存提高27个百分点;
- 整体留存大约提高10% × 27 = 2.7个百分点。
这个算法把最慢的10%都当成了45%的留存。其实其中一半(P95以上)超过6.2秒,留存只有28%甚至12%。把这一半也提到4秒以内,收益更大:5% ×(72 − 45)加上5% ×(72 − 28)到5% ×(72 − 12),合计大约3.5到4.4个百分点。
还要注意,这张留存表是按加载时间分组看到的相关关系。加载慢的用户,可能本来就网络差、设备旧、所在的市场不同,提速以后不一定能完全换来这么多留存。要知道真实的效果,最好用前面讲的人为减速实验去测。
第二部分:飞轮分析
平台每月的数据如下:
| 指标 | 数值 |
|---|---|
| 活跃创作者 | 1,000 |
| 每个创作者每月新发视频 | 3.2 |
| 每个视频的平均观看次数 | 5,000 |
| 评论率(每次观看产生的评论) | 2.1% |
| 创作者回复率(得到创作者回复的评论比例) | 15% |
问题:
- 画出这个平台的创作者飞轮有哪些关键环节。
- 根据这些数据,找出当前飞轮最薄弱的一环。
- 提出一个加强这一环的具体实验,包括你的假设,以及怎么衡量成功。
参考答案:
先把数字连起来算一遍:每月1,000 × 3.2 = 3,200个新视频,3,200 × 5,000 = 1,600万次观看,1,600万 × 2.1% ≈ 33.6万条评论,其中15%,约5万条得到了创作者回复。
问题1:飞轮的关键环节:
内容生产 → 内容库存 → 内容分发(观看)→ 用户互动(评论)→ 创作者回复 → 创作者的动力 → 回到内容生产。
问题2:最薄弱的一环是创作者回复率,只有15%,也就是85%的评论没有得到回应。这可能让互动的循环断掉:用户觉得评论了也没人理,就不再评论;创作者也少了一个了解观众的渠道。
严格地说,判断哪一环最弱,最好有基准,比如和平台自己的历史比,或者和同类平台比。另外,算一下就会发现,平均每个创作者每月要面对336条评论,一天十来条。回复率低,可能不是因为创作者不想回,而是回不过来。这会影响你选什么样的实验。
问题3:一个实验方案:
- 假设:在推荐里突出那些积极回复的创作者(回复率超过30%),能提高整体的创作者回复率。
- 主要指标:创作者回复率。
- 次要指标:评论率、创作者发视频的频率、观看留存。
- 成功标准:四周内创作者回复率提高25%,而且次要指标没有变差。
设计这个实验时要注意两点。
第一,整体回复率提高,可能只是因为流量和评论更多地流向了本来就爱回复的创作者,并没有任何一个创作者改变行为。所以除了整体回复率,还要看每个创作者自己的回复率有没有变化。
第二,按观众随机分组时,两组看的是同一批创作者,实验组的推荐变化会影响对照组看到的创作者,两组并不独立。如果想知道「回复能换来推荐」会不会让创作者更愿意回复,应该按创作者随机分组,并且告诉实验组的创作者这条规则。
注释
Qike (Max) Li,「How Wish A/B Tests Percentiles」,Medium,2021年8月9日,https://medium.com/data-science/how-wish-a-b-tests-percentiles-35ee3e4589e7。↩︎
下载整本书
Growth Data Analytics Playbook 中文版,免费下载。