Growth Data Analytics Playbook 中文版第2章

找到产品价值的早期信号

对应原书 Chapter 2: Identify Early Signals of Product Value and Success

先回答一个问题:用户真的需要它吗

每个成功的产品,都要先回答同一个问题:我的产品有没有给用户带来真实的价值?这就是产品市场匹配(Product-Market Fit,PMF)要回答的问题。可以把PMF当成产品开发的指南针。Meta的分析团队在博客里给过一个定义:PMF是「一个产品在满足某个细分市场需求时所提供的价值」。1等第一个原型做完、产品真的能给用户用了,就该开始评估它。

💡 很多产品一开始的点子很好,却死在PMF这一步,因为它们是照着创始人的假设做的,而不是照着用户的真实需求。

看PMF要从三个角度看:

  1. 人群。PMF是针对特定人群的。产品不需要人人都喜欢,但必须把目标用户的需求满足得很好。
  2. 时间。PMF不是一次拿到就永远有效。产品在变,市场在变,用户需求也在变,要持续盯着,保证还对得上。
  3. 程度。PMF不是一道是非题,而是一个程度。关键看产品带来的价值,够不够撑起规模化。

下面四个例子说明,为什么评估PMF这么重要:

  • 没有PMF就做增长,会摔得很惨。BranchOut是2010年上线的一个Facebook应用,想做求职、职业社交和招聘。它在找到PMF之前就迅速涨用户,融了4900万美元,之后用户大幅流失,公司只好转型。
  • PMF能让你早早看出市场会不会买单。比如一个AI聊天机器人上线以来周环比增长50%,80%的用户续订。
  • PMF能验证你的竞争优势。比如一项调查显示,40%的新用户是从竞品AI平台转过来的。
  • PMF还会带出意料之外的机会。比如这个AI聊天机器人在科技行业的使用不如预期,在体育行业却意外地好。

衡量PMF最关键的指标:留存

看看你的手机,大概装了几十个app,但每天真正在用的只有几个。它们证明了自己的价值,一直给你带来好处,所以才留在你的主屏幕上。这就是为什么留存是衡量产品成败最有力的指标。

评估PMF有很多指标可看,留存是其中最关键的一个。道理很简单:用户觉得有价值,就会一直回来。留存还有两个特点,让它格外有用:

  1. 用户很少的时候也能看出东西。在评估PMF的阶段,用户量往往不大,又特别需要反馈,留存这时就很有信息量。
  2. 留存直接关系到增长潜力。好产品会让使用量和收入越来越多,进一步推动增长。

一句话:留存衡量的是有多少用户随着时间推移还在继续用你的产品,它说明产品在持续地交付价值。

留存分析的四个组成部分

  1. 定义「活跃」。先想清楚,对你的产品来说什么算活跃。对一个AI聊天机器人,开启一次对话就可以算。
  2. 定义使用频率。用户应该多久用一次你的产品?这因产品而异:聊天工具追求每天用,订旅行的平台可能一个月用一次就算正常。
  3. 划分时间窗口。分短期(7天)、中期(30到60天)、长期(180天以上)来看用户行为。
  4. 按cohort分析。把用户按开始使用的时间分组,追踪不同组的留存怎么变化。

留存率的计算公式:

第Y天留存率 = 第Y天仍活跃的用户数 ÷ 这个cohort的初始用户数

举个例子。2022年元旦你上线了一个新app,第一天来了100个用户。到1月8日,看板显示其中20个人那天还在用。那么这个cohort的第7天日活留存率就是20%(20 ÷ 100)。这个简单的数,能告诉你app在用户第一周之后留得住多少人。

留存曲线的三种形态

用户刚发现你的产品时,有人会留下,有人会慢慢走掉。把留存的用户比例随时间画出来,就是留存曲线。对面向消费者(B2C)的产品,这条曲线通常是这样的:一开始急剧下降,随便看看的人走了;然后曲线开始变平,真正觉得产品有价值的人留了下来。

💡 留存曲线没有统一的标准形状,产品类型不同、服务的人群不同,曲线可能长得很不一样。

不管按天、按周还是按月画,这张图告诉你的不只是数字,还有人们怎么用你的产品,以及你做的东西能不能长久。

图2-1 三种留存曲线。纵轴是仍活跃的用户比例,横轴是获客之后的天数:最上面是很好的留存(Great Retention),中间是不错的留存(Good Retention),最下面是差的留存(Bad Retention),说明还没找到PMF

理想情况:微笑曲线。最上面那条线,是每个产品团队的梦想:用户不仅留下来,一些走了的人还会回来,曲线末端往上翘。这种「微笑」很少见,通常只出现在成了用户离不开的工具的那类产品上。

健康的现实:平台期。中间那条线,代表一个健康、可持续的产品。开头下降是因为随便看看的人走了,但有一批核心用户找到了持久的价值,一直在用。大多数成功产品的目标就是这条线。

危险信号:一路下滑。如果你的留存像最下面那条线一样一直往下掉,就该先停下增长动作,把精力放在修好产品的核心价值上。

怎么读cohort表

要准确追踪这些形态,用cohort表。它让你比较同一时间开始用产品的用户组,留存是怎么变的。cohort分析需要一定的用户量才有意义,而且它揭示的是趋势,不是统计上的定论。

图2-2 cohort表:每一行是一组同一周注册的用户,每一列是注册后的第几周,格子里是这组用户在那一周的留存率

一张cohort表可以从三个方向读,每个方向讲的是不同的故事。

横着读:看一组用户随时间怎么变。比如5月18日这组用户,如果他们在第五周之后参与度异常地高,说明最近的某个改动(也许是新功能,也许是一次改进)打动了他们。

图2-3 横向读:同一组用户在注册后各周的留存率

竖着读:看产品怎么随时间进化。每一行是不同周开始用产品的一组用户。理想情况下,产品在改进,越新的用户组应该留得越久。

看数据:从第三周开始,规律很清楚,每组新用户的留存都比上一组好,说明产品改进起作用了。但7月6日之后加入的用户留存意外下滑,这就是一个该去查的信号:是功能改动,还是bug?弄清这次下滑,才能找回势头。

图2-4 纵向读:比较不同时期注册的用户组在同一阶段的留存

斜着读:看某个具体日期发生了什么。比如8月17日出现了一个异常:几乎每一组用户,不管哪天开始用的,参与度都突然下降。这种所有人同时受影响的规律,通常意味着那天发生了一件事:可能是线上出了技术故障,也可能是某个重要市场出了外部状况。斜着读能逼你去问这些问题,然后改进和应对。

图2-5 斜向读:同一个日历日期上,各组用户的留存同时变化

我的留存够好吗

产品上线以后,你大概会问:我们走对了吗?留存就是产品的成绩单,告诉你用户是不是在你做的东西里找到了真实的价值。

就像医生体检要看好几项生命体征,判断留存「够不够好」也要看几个方面:

  1. 先自查。跟自己的过去比:新的用户组是不是比早期的留得更久?这说明团队有没有在学习和改进。
  2. 再找参照。跟你所在领域的同类产品比。比如你在做AI聊天机器人,就拿成熟的客服消息类app的留存来对照,这能告诉你在你的市场里,「好」大概是什么样。
图2-6 按获客cohort看的短期留存示例。WAU是周活跃用户,指一周内至少用过一次产品的人数

留存上常见的四个坑

下面是四位产品经理用惨痛代价换来的教训:

  • Sarah直接照搬了Netflix公开过的留存指标,觉得「对他们有用,对我们也有用」。很快她就发现,她的冥想app和社交、媒体产品的使用规律完全不同:一周冥想一次的用户就可以算很投入,而媒体产品的常态是每天用。
  • Mike很得意,他的产品短期留存20%,超过了竞品的15%。但他忽略了一个关键细节:他们团队按登录算留存,竞品按真正使用功能算。
  • Alex以为拿到PMF就能松口气了:「留存这么好,现在可以专心做增长了!」半年后她震惊地发现,留存大跌,因为用户从早期的技术尝鲜者变成了大众用户。
  • Jamie想用留存来快速决定新功能要不要上,结果很快明白:留存是滞后指标,改动的真实影响要好几周才看得出来,不适合快速实验。

这四个故事对应四个要避开的坑:

  1. 别照搬别人的指标。你的产品有自己的特点,留存框架要量身定做。
  2. 比较留存要小心。口径不同,结论就可能是误导。
  3. 拿到PMF之后也要继续盯。用户群和产品都会变。
  4. 记住留存是滞后的。快速决策要靠别的指标,留存讲的是更长的故事。

案例:切水果手游

设想一个正在开发的手游:水果和蔬菜从天上掉下来,玩家滑动屏幕去切,切中就得分。玩法简单、上手快,可能很上瘾。可团队怎么确定,自己做的是用户真正想要的东西?

留存是PMF最强的信号之一,所以团队把它当作重点。在看数据之前,先把衡量框架定清楚。

先定衡量框架

  1. 什么算活跃:玩够10秒。这个门槛能把真玩家和误点打开的人分开。
  2. 使用频率:每一关只要几分钟,目标是每天都玩,符合休闲游戏的规律。
  3. 看哪几个时间点:
    • 第7天:玩家第一周之后还回来吗?
    • 第60天:游戏成了他们固定的娱乐了吗?
    • 第180天:游戏能长期提供乐趣吗?

框架定好,团队就可以追踪游戏留不留得住玩家了。

留存曲线

图2-7 这款手游的假想留存曲线

数据显示出三个阶段:

  1. 开头很投入:头几周玩家在积极探索游戏。
  2. 中期下滑:新鲜期过后,参与度明显下降。
  3. 长期流失:活跃玩家在更长的时间里大幅减少。分析发现,玩家往往玩到某一关就不玩了,而那一关正是游戏的最后一关。
图2-8 各组玩家的短期(DAU@7)、中期(WAU@60)和长期(MAU@180)留存走势

按cohort看短、中、长期留存的时间序列,没有发现令人担心的趋势:长期留存低,并不只是最近的玩家才这样。规律很清楚:玩家通关最后一关以后,就不再玩了。就像读完一本好看的书,没有新内容了,自然就放下了。

产品优化的机会

13到18岁的玩家留存明显低于其他年龄段。用户研究发现,这些年轻玩家对苹果、西瓜这些传统水果没感觉,他们更喜欢影视作品和网红带火的虚构水果和食物。

图2-9 不同年龄段玩家在各cohort的短期留存

按国家看留存,亚洲的留存明显偏低。用户研究发现,游戏里的水果对亚洲玩家来说很陌生。把各地流行的本地水果加进游戏后,玩家对玩法更有共鸣,留存和增长都上去了。

图2-10 不同地区的短期留存

解决办法

团队从讲故事里找灵感:就像新的章节能让一本书重新好看起来,他们做了一批有主题的新关卡来留住玩家。在亚洲市场加入本地流行的水果,让玩家一眼认出来;水果还会跟着热门话题和季节轮换,保持新鲜感。再配上有针对性的游戏内推送,吸引玩家回来体验这些按文化定制的新内容。

结果

效果很好。追踪各cohort的J形曲线可以清楚看到,玩家回来玩这些新关卡,游戏重新活了过来。

图2-11 推出新主题和新关卡后,按月cohort看的留存曲线

留存太慢,就用领先指标

你上线了一个新功能,等着看用户反应。传统做法是看长期留存,比如180天后还有谁在用。问题是等这么久,可能已经错过了改进或转向的关键时机。

这时就要看「激活」(activation)。把它当作预警系统:就像医生能从生命体征预判健康风险,团队也能从用户早期的特定行为,预测他们会不会长期留下。

不必等180天,而是盯住用户在头两周里做没做某些事。这些早期信号能告诉我们方向对不对,让决策更快、更有依据。

这个方法不只用于留存。类似的早期指标还能预测别的结果,比如一个用户转成付费用户的可能性。

选早期信号,要看三个性质:

  • 可预测:像天气预报一样,能准确预测未来的行为。
  • 可测量:变化要能很快被发现,做实验时尤其重要。
  • 简单:团队里每个人都明白量的是什么、为什么量。

找到预示长期成功的领先指标

假设你在做一个视频流媒体app,你发现第一周看了超过十分钟视频的用户,更可能成为长期用户。这就是一个领先指标(leading indicator),一个预示未来成功的早期信号。Facebook早年发现,新用户在头10天里加到7个好友,就更可能留下来。这样的「aha moment」,是理解产品为什么成功的关键。

要找到这些关键时刻,先定两件事:

  1. 看什么行为。先挑出可能预示成功的行为。对视频app来说,可以是观看时长、看了几个视频、单次观看多久。
  2. 在多长的窗口里看。如果营销需要快速反馈,就看第一天的行为;想看更深的投入,就用七天窗口。

两件事定好,就能写出具体的候选指标,比如「头七天看视频超过十分钟的用户」。

但候选指标的价值并不相同。要挑出最好的,用F1分数。它平衡两件事:

  • 精确率(precision):满足这个条件的用户里,有多少人后来真的留了下来;
  • 召回率(recall):真正留下来的用户里,有多少人满足这个条件。

可以把它理解成,在「标准太严」和「标准太松」之间找到最合适的点。

F1 = 2 × 精确率 × 召回率 ÷(精确率 + 召回率)

其中,精确率 = TP ÷(TP + FP),召回率 = TP ÷(TP + FN)。TP是真阳性:指标说会留、也真的留了;FP是假阳性:指标说会留、其实走了;FN是假阴性:指标没选中、其实留了。

图2-12 验证领先指标:用户注册后,按领先指标(Leading Indicator)是否达成、和成功指标(Success Metric)是否达成,分成真阳性、假阳性、假阴性、真阴性四类,F1分数就用这四类来算

算出每个候选指标的精确率和召回率,画在一张图上:

  • 横轴是精确率:越高,说明这个指标挑出的人里,真长期用户越多;
  • 纵轴是召回率:越高,说明真长期用户被这个指标覆盖得越全。

图上的点会呈现精确率和召回率的取舍:通常一个高了,另一个就低了。最理想的指标在右上角,两个都高。这张图帮团队在「太严」(精确率高、召回率低)和「太松」(精确率低、召回率高)之间找平衡。

图2-13 把各候选指标的精确率和召回率画在一张图上

另一个办法是用机器学习模型,比如决策树,或者带L1正则(也叫LASSO)的逻辑回归,找出和留存强相关的候选。比如用决策树时,如果第一次分裂发生在「头七天看了超过十个视频」,这个指标就是留存最好的预测因子。

图2-14 短视频app的留存驱动因素决策树:第一层看头七天是否看了超过10个视频,再看观看时长、互动和点赞,最右边一支(看了超过10个、时长超过30分钟)的留存概率超过80%

可测量性

可测量性看的是:指标发生有意义的变化,要多久才能在统计上测出来。做法是用你的实际流量(全量或一半流量),算出在实验里测出某个百分比变化需要多少天。用标准的t检验样本量公式,或者R、Python里现成的样本量计算包就能算。比如一个指标要一个月才能测出20%的变化,就该换掉它:更小的变化要测更久,会拖慢决策。

把可预测性和可测量性放在一起看

算完每个候选的F1分数和测出显著变化需要的天数,把它们画在一张图上,每个点是一个候选指标。这张图能帮你找到可预测性和可测量性组合最好的指标。

如果几个指标的F1和可测量性差不多,就要靠主观判断了。通常,最好的领先指标是最简单的那个:一个动作的指标够用,就别选三个动作的。

一个提醒

领先指标和长期留存的关系会随时间变化。用户群变了,或者给新用户上了新功能,都可能让原来的指标不再灵。所以要持续盯着这些指标的可预测性和可测量性,至少每年重新评估一次。

案例:给视频app找领先指标

来看一个真实的用法。你是一个视频流媒体app的数据科学家,产品经理请你做一个用来看实验的指标,要求它和长期留存强相关。

按前面说的标准,你提出了几组候选指标,算出了它们的精确率、召回率和F1分数(表2-1)。数据显示出精确率和召回率之间有意思的取舍。

候选指标分三类,都看用户头七天的行为:

  • ActiveHour_Day7_LongerThan_X:头七天活跃时长是否超过X小时;
  • NumberOfVideo_Day7_MoreThan_X:头七天看的视频是否超过X个;
  • LongestVideoMin_Day7_LongerThan_X:头七天里有没有一个视频看了超过X分钟。

每类指标用了不同的门槛X,看哪个投入程度最能预测留存。

指标 精确率 召回率 F1分数
ActiveHour_Day7_LongerThan_1 0.60 0.75 0.667
ActiveHour_Day7_LongerThan_2 0.70 0.65 0.674
ActiveHour_Day7_LongerThan_3 0.90 0.10 0.180
NumberOfVideo_Day7_MoreThan_1 0.50 0.85 0.630
NumberOfVideo_Day7_MoreThan_2 0.55 0.75 0.635
NumberOfVideo_Day7_MoreThan_3 0.65 0.45 0.532
LongestVideoMin_Day7_LongerThan_10 0.40 0.55 0.463
LongestVideoMin_Day7_LongerThan_20 0.63 0.46 0.532
LongestVideoMin_Day7_LongerThan_30 0.70 0.34 0.458
LongestVideoMin_Day7_LongerThan_60 0.85 0.25 0.386

表2-1 头脑风暴出来的候选指标

把这些点画出来可以看到:注册后头七天观看超过两小时,精确率和召回率的平衡最好。

图2-15 各候选领先指标的精确率与召回率

还要看这个指标能不能在实验里足够快地测出来。把F1分数和功效分析(power analysis)的结果画在一起:功效分析告诉你,要测出指标10%的变化需要多少样本,再除以每周的用户流量,就得到需要观察多少天。在这个例子里,测出10%的变化只要一周多,放进标准的两周实验窗口里正好。所以它很适合用来衡量改动对用户的长期影响。

图2-16 各候选指标在实验中测出有意义变化需要的天数(横轴)与F1分数(纵轴);空心圈是选中的「头七天活跃超过两小时」

本章要点

LinkedIn这样的公司一直把留存放在核心位置。他们专门看用户半年后还回不回来,在节奏很快的科技行业,这已经是很长的时间了。理由很清楚:半年后还在用的人,多半是真的觉得这个平台有价值。

留存为什么这么有用?第一,它简单。不管跟同事还是投资人讨论,大家都明白最根本的问题:用户还回不回来?第二,它能告诉你产品表现的历史。看不同用户组随时间的留存曲线,就能判断产品改动有没有带来实质的变化。

  1. 要把留存量好,需要三样东西:
    • 对你的产品来说,什么算「活跃」,定义清楚;
    • 用户自然的使用频率是多少;
    • 在哪个时间段里衡量。
  2. 留存在三件事上帮你:
    • 它是PMF的有力信号,告诉你做的东西是不是大家普遍想要的;
    • 它能找出哪些用户最看重你的产品,帮你找到更多类似的人;
    • 它能指出哪些用户行为带来长期忠诚,告诉你该推广什么。
  3. 但留存有一个局限:它是后视镜。所以积极的团队还会追踪能预测留存的早期信号。把这些领先指标当作产品的生命体征,在问题变大之前就发现它们。

练习:手游的领先指标

你是一家手游公司的数据科学家,游戏免费,靠游戏内购买赚钱。下面是2024年1月安装游戏的几位用户的数据:

用户ID 第一周玩的局数 第一周游戏时长 第一周内购金额 第30天是否留存
1001 25 180分钟 $0 是
1002 5 30分钟 $0 否
1003 15 120分钟 $4.99 是
1004 30 240分钟 $9.99 是
1005 3 15分钟 $0 否

表2-2 游戏用户指标

问题1:下面三个候选领先指标,精确率和召回率各是多少?

  1. 第一周玩超过10局;
  2. 第一周玩超过60分钟;
  3. 第一周有过任何内购。

问题2:哪个指标的F1分数最高?

问题3:根据结果,你会推荐哪个指标作为这款游戏的领先指标?

答案

问题1:

  1. 玩超过10局:满足条件的3个人都留下了,精确率 = 3/3 = 1.00;留下的3个人都满足条件,召回率 = 3/3 = 1.00;F1 = 2 × 1.00 × 1.00 ÷(1.00 + 1.00)= 1.00。
  2. 玩超过60分钟:同样是那3个人,精确率 = 1.00,召回率 = 1.00,F1 = 1.00。
  3. 有过内购:有内购的2个人都留下了,精确率 = 2/2 = 1.00;留下的3个人里只有2个有内购,召回率 = 2/3 ≈ 0.67;F1 = 2 × 1.00 × 0.67 ÷(1.00 + 0.67)≈ 0.80。

问题2:「玩超过10局」和「玩超过60分钟」并列最高,F1都是1.00。

问题3:推荐用「玩超过10局」,因为:

  1. 在这组样本里,它的精确率和召回率都最好;
  2. 局数比时长更容易量;
  3. 产品团队更容易围绕「多玩几局」去设计功能,它更能落到行动上。

注释

  1. Analytics at Meta,「Analytics and Product-Market Fit」,Medium,2022年9月7日,https://medium.com/@AnalyticsAtMeta/analytics-and-product-market-fit-11efaea403cd。↩︎

下载整本书

Growth Data Analytics Playbook 中文版,免费下载。