Growth Data Analytics Playbook 中文版第8章

优化性能,打造增长飞轮

对应原书 Chapter 8: Optimize Performance and Build Sustainable Growth Flywheels

前面几章讲的是增长分析的基本功:理解用户行为,衡量参与度,做实验、分析结果,找机会,建可靠的指标,用数据做决定。

这一章转向两个更专门的话题。产品成熟以后,有经验的增长分析师一定会碰到它们:性能和飞轮。它们建立在前面的基础上,但关注的是具体的杠杆和机制。基本的增长框架搭好以后,这些杠杆对产品的影响会非常大。

被低估的性能

点一个按钮,然后等,等,再等。很多人都有过这种烦躁。性能,也就是产品响应用户操作的速度,可以直接决定用户体验的好坏。不管是打开app、刷新页面,还是简单地打字,每一毫秒都影响用户愿不愿意继续用、满不满意。

性能(performance)和可靠性(reliability)常被混为一谈,其实是两回事。性能像一辆车开得多快,可靠性是这辆车能不能发动。可靠性关心产品能不能正常工作:会不会崩溃?有没有响应?性能关心的是响应有多快。

用「完成某件事要多久」这类指标衡量性能时,重点不是中位数,而是P90或P95,也就是最慢的那10%或5%的体验。为什么盯着这些极端情况?因为大多数用户可能都满意,但碰上慢的那些人,最可能放弃产品。把这些最慢的情况改善了,不但能留住高风险的用户,往往也会让所有人的体验变好。

看一个典型的网页加载时间分布。它明显向右偏:大部分加载很快,但有一条长长的尾巴。

图8-1 一个网页的加载时间分布:中位数是2.11秒,P95是6.92秒

假设你是一个正在赶着上线产品的创业者。性能优化看起来是你现在负担不起的奢侈品,你需要的是一个能用、用户喜欢的产品。这在科技行业很普遍:早期,性能往往排在后面。可一旦产品有了起色,同样的性能,就可能成为强大的增长动力。

怎么说服团队在性能上投入?有两种基于数据的办法。

探索分析。深入用户日志,找出速度和产品成败之间的关系。具体做法是:把用户留存对性能做逻辑回归,同时控制app类型、国家、网速这些变量。

  • 按app类型、国家和团队规模,画出性能的分布规律;
  • 用严谨的统计分析,找出速度和留存之间的关系。

反向实验。有时候,证明性能有价值的最好办法,是暂时把它拿走。做一个A/B/n实验,同时测试几种不同程度的人为减速,比如分别慢100毫秒、300毫秒和500毫秒,看用户的反应。这样能直接测出速度对用户满意度的影响。

关键在于:不是所有的慢,对用户的影响都一样。复制一个很大的模板,用户愿意耐心等;页面加载慢,用户很快就没耐心了。说到底是预期管理。

要把力气花在最值得的地方:

  • 最重要的操作:用户每天都依赖的核心功能,比如编辑文档。要同时考虑参与度和使用频率。
  • 最重要的界面:把它们当成你的门面,比如官网、通知和导航。第一印象很关键。
  • 最重要的场景:不同的场景对速度的要求不同,比如一个人编辑和多人协作,就要分开对待。

做成这件事,要靠数据分析师和工程师配合。分析师找规律,工程师保证测的是对的东西:测用户实际感受到的体验,而不是后端的处理时间。

最后一块拼图是定清楚目标。画一条「放弃曲线」,看加载越慢,有多少用户放弃,就能找出不同地区和设备上的关键门槛。

数据呈现出很清楚的规律:一开始只有零星的人放弃;超过3到5秒这个关键门槛后,放弃的人急剧增加;最后稳定在90%左右。记住两个数:3秒,是用户开始流失的临界点;50%的放弃率,是很难挽回的分界线。

图8-2 模拟的放弃率和加载时间的关系:3秒是临界点,之后放弃率快速上升,越过50%后趋于稳定在90%左右

接下来用A/B测试来验证。你把app的加载时间优化好了,怎么证明它的效果?标准的A/B测试方法(第十章会详细讲)是很好的基础,但性能指标有它特殊的地方。分析P90、P95这样的百分位数时,传统的t检验可能不够用。就像要比较一个房间里最高的人有多高,平均身高说明不了问题。

这时候需要专门的统计工具。百分位数不是均值,标准t检验的前提不直接成立,常见的做法是用bootstrap,或者专门推导的方差公式。另外,实验通常按用户随机分组,加载时间却是按每次加载记录的,一个用户会有很多次加载,算方差时也要考虑这一点。包括Wish在内的几家公司,在百分位数的A/B测试上做了很好的探索,可以读Qike (Max) Li的文章《How Wish A/B Tests Percentiles》。1

飞轮效应:把小胜利变成停不下来的势头

想象你在推一个巨大的轮子。一开始它几乎不动,每推一下都很费劲。但只要一直推下去,轮子会越转越轻松,每转一圈都更快。这就是飞轮:一种把断断续续的力,转化成稳定持续动力的机械装置。

在商业上,吉姆·柯林斯(Jim Collins)在《从优秀到卓越》(Good to Great)里讲过这个概念。物理的飞轮把不规律的推力变成平稳的转动;商业的飞轮,把一个个小而持续的行动,变成停不下来的势头。每一个客户的成功、每一次产品改进、每一次好的互动,都在给飞轮加速,让未来的增长越来越省力。

对数据科学家来说,飞轮不只是一个比喻,而是一个衡量和推动可持续增长的框架。你的任务是和产品团队一起,找出、衡量并优化自己产品的飞轮。

每个产品的飞轮都不一样。交易平台的飞轮,是买家和卖家互相为对方创造价值;内容平台的飞轮,是创作者和消费者之间的良性循环:好内容吸引更多投入的用户,又激励创作者做出更多好内容。下面看一个具体的例子。

图8-3 创作者飞轮:创作者发布内容、和用户互动 → 可以推给用户的内容更多 → 用户看到相关的内容 → 用户评论、点赞 → 回到创作者

这就是创作者飞轮,一个自我强化的循环。它这样运转:创作者发布独特的内容,丰富了平台的内容库;推荐算法通过个性化的信息流,把内容送到合适的观众面前;用户看到喜欢的内容,就会评论、点赞,形成活跃的社区讨论;这些互动激励创作者回应观众,做出更好的内容,循环就闭合了,而且越转越强。

要发挥飞轮的作用,就要定期检查它的各项体征。定义和追踪这些指标,是数据科学家的重要工作。对创作者飞轮,可以用这几个指标判断势头是不是在积累:

  1. 内容生产:每个创作者发了多少内容、多频繁,这是平台的命脉。
  2. 内容库存:有多少高质量、相关的内容可以推给用户,衡量内容生态的多样和深度。
  3. 曝光:通过观看次数和互动率,衡量内容的触达和分发效果。
  4. 反馈:从简单的点赞到认真的评论,量化用户的互动,衡量社区有没有活力。
  5. 创作者互动:创作者回应观众的速度和程度,衡量社区的健康。

密切追踪这些指标,就能发现早期的预警信号,及时肯定做得好的地方,用数据做决定,让飞轮保持在最好的速度。这就是你的增长仪表盘,每个指标都反映平台的势头和潜力。

搭建增长飞轮:一个分步框架

打造一个有力的飞轮,不只是画几个圈和箭头,而是要设计一个能自我强化、推动可持续增长的系统。下面是搭建和衡量飞轮的完整步骤。

1. 打好地基

  • 找出驱动产品成功的核心要素,包括获客和参与的循环;
  • 把这些要素之间的因果关系理清楚。比如,看参与度提高怎样带来更多的口碑增长。

2. 划分阶段

  • 把飞轮分成几个清楚、能落到行动上的阶段,首尾相连形成循环,每一个环节都增强下一个;
  • 确保每个阶段自然地产生动力,推动下一个阶段。

3. 衡量真正重要的东西

每个阶段都要有能准确反映表现的指标,重点看这几块:

  • 内容生产:新内容的质量和数量;
  • 内容分发:触达和互动指标;
  • 用户互动:互动的深度和频率;
  • 社区增长:网络效应和病毒系数;
  • 创作者的成功:创作者的留存和满意度。

4. 监测势头

  • 建立可靠的追踪系统,实时掌握飞轮的状态;
  • 用时间序列分析找规律、预测趋势、发现早期预警;
  • 设定合理的报警阈值,在小问题变成大障碍之前处理掉。

5. 优化加速

  • 针对每个阶段做有针对性的实验。比如测试不同的内容推荐算法,看哪个更能提高互动;
  • 找出并清除拖慢飞轮的摩擦点。

6. 对齐战略目标

  • 确保飞轮直接支撑公司的北极星指标和业务目标;
  • 做清楚透明的报告,说明飞轮对业务的影响。

7. 持续演进

  • 产品和市场在变,飞轮也要定期重新评估和调整;
  • 衡量体系要灵活,新机会出现时能及时跟上。

8. 用自动化提效

  • 搭建可靠的数据基础设施,自动收集关键指标并做成可视化;
  • 用智能监控系统,提前发现和处理潜在的问题。

有效的飞轮靠的是数据和持续优化,不是希望和假设。落实这些策略时,要一直盯着实际的效果,根据真实的结果迭代。飞轮不该只是一张漂亮的图,而是一台每转一圈都更强的增长引擎。

本章要点

这一章讲了增长分析里两个更专门的话题:性能和飞轮。

  • 性能分析:看P90/P95,不只看平均数;和工程团队一起保证计时准确;用放弃曲线定出有意义的性能目标。
  • 飞轮框架:理解并落实飞轮,是可持续增长的关键。要找出、衡量并优化每个产品自己的飞轮。
  • 用数据驱动:做好性能优化和飞轮,需要:
    • 定期监测关键指标;
    • 持续实验和优化;
    • 和业务目标清楚地对齐;
    • 随着产品演进不断调整。

练习

你是一个视频流媒体平台的增长分析师,最近发现用户参与度有一些令人担心的趋势。

第一部分:性能分析

视频加载时间的数据如下:

百分位 加载时间
P50 2.1秒
P90 4.8秒
P95 6.2秒

不同加载时间下的用户留存:

加载时间 留存率
0到2秒 85%
2到4秒 72%
4到6秒 45%
6到8秒 28%
8秒以上 12%

问题:

  1. 为什么在这个例子里,要关注P90/P95,而不是中位数(P50)?
  2. 根据留存数据,你会把加载时间的关键门槛定在多少?
  3. 如果能把所有P90的体验都改善到4秒以内,整体留存可能提高多少?

参考答案:

问题1:P90/P95反映的是最差的那些体验,它们对留存的影响不成比例地大。P50只说明一般情况,而真正把用户赶走的,往往是那些很慢的极端情况。这个例子里,中位数2.1秒落在72%的留存区间,看起来没问题;可P90的4.8秒和P95的6.2秒,分别落在45%和28%的区间。

问题2:把门槛定在4秒,因为:

  • 过了4秒,留存从72%骤降到45%;
  • 这和行业里常说的3到5秒门槛一致;
  • 这是一个技术上现实的目标。

问题3:粗略的算法是:

  • 现在的P90是4.8秒,落在4到6秒的区间,留存45%;
  • 改善到4秒以内,进入2到4秒的区间,留存72%;
  • 最慢的10%体验,留存提高27个百分点;
  • 整体留存大约提高10% × 27 = 2.7个百分点。

这个算法把最慢的10%都当成了45%的留存。其实其中一半(P95以上)超过6.2秒,留存只有28%甚至12%。把这一半也提到4秒以内,收益更大:5% ×(72 − 45)加上5% ×(72 − 28)到5% ×(72 − 12),合计大约3.5到4.4个百分点。

还要注意,这张留存表是按加载时间分组看到的相关关系。加载慢的用户,可能本来就网络差、设备旧、所在的市场不同,提速以后不一定能完全换来这么多留存。要知道真实的效果,最好用前面讲的人为减速实验去测。

第二部分:飞轮分析

平台每月的数据如下:

指标 数值
活跃创作者 1,000
每个创作者每月新发视频 3.2
每个视频的平均观看次数 5,000
评论率(每次观看产生的评论) 2.1%
创作者回复率(得到创作者回复的评论比例) 15%

问题:

  1. 画出这个平台的创作者飞轮有哪些关键环节。
  2. 根据这些数据,找出当前飞轮最薄弱的一环。
  3. 提出一个加强这一环的具体实验,包括你的假设,以及怎么衡量成功。

参考答案:

先把数字连起来算一遍:每月1,000 × 3.2 = 3,200个新视频,3,200 × 5,000 = 1,600万次观看,1,600万 × 2.1% ≈ 33.6万条评论,其中15%,约5万条得到了创作者回复。

问题1:飞轮的关键环节:

内容生产 → 内容库存 → 内容分发(观看)→ 用户互动(评论)→ 创作者回复 → 创作者的动力 → 回到内容生产。

问题2:最薄弱的一环是创作者回复率,只有15%,也就是85%的评论没有得到回应。这可能让互动的循环断掉:用户觉得评论了也没人理,就不再评论;创作者也少了一个了解观众的渠道。

严格地说,判断哪一环最弱,最好有基准,比如和平台自己的历史比,或者和同类平台比。另外,算一下就会发现,平均每个创作者每月要面对336条评论,一天十来条。回复率低,可能不是因为创作者不想回,而是回不过来。这会影响你选什么样的实验。

问题3:一个实验方案:

  • 假设:在推荐里突出那些积极回复的创作者(回复率超过30%),能提高整体的创作者回复率。
  • 主要指标:创作者回复率。
  • 次要指标:评论率、创作者发视频的频率、观看留存。
  • 成功标准:四周内创作者回复率提高25%,而且次要指标没有变差。

设计这个实验时要注意两点。

第一,整体回复率提高,可能只是因为流量和评论更多地流向了本来就爱回复的创作者,并没有任何一个创作者改变行为。所以除了整体回复率,还要看每个创作者自己的回复率有没有变化。

第二,按观众随机分组时,两组看的是同一批创作者,实验组的推荐变化会影响对照组看到的创作者,两组并不独立。如果想知道「回复能换来推荐」会不会让创作者更愿意回复,应该按创作者随机分组,并且告诉实验组的创作者这条规则。

注释

  1. Qike (Max) Li,「How Wish A/B Tests Percentiles」,Medium,2021年8月9日,https://medium.com/data-science/how-wish-a-b-tests-percentiles-35ee3e4589e7。↩︎

下载整本书

Growth Data Analytics Playbook 中文版,免费下载。