先回答一个问题:用户真的需要它吗
每个成功的产品,都要先回答同一个问题:我的产品有没有给用户带来真实的价值?这就是产品市场匹配(Product-Market Fit,PMF)要回答的问题。可以把PMF当成产品开发的指南针。Meta的分析团队在博客里给过一个定义:PMF是「一个产品在满足某个细分市场需求时所提供的价值」。1等第一个原型做完、产品真的能给用户用了,就该开始评估它。
💡 很多产品一开始的点子很好,却死在PMF这一步,因为它们是照着创始人的假设做的,而不是照着用户的真实需求。
看PMF要从三个角度看:
- 人群。PMF是针对特定人群的。产品不需要人人都喜欢,但必须把目标用户的需求满足得很好。
- 时间。PMF不是一次拿到就永远有效。产品在变,市场在变,用户需求也在变,要持续盯着,保证还对得上。
- 程度。PMF不是一道是非题,而是一个程度。关键看产品带来的价值,够不够撑起规模化。
下面四个例子说明,为什么评估PMF这么重要:
- 没有PMF就做增长,会摔得很惨。BranchOut是2010年上线的一个Facebook应用,想做求职、职业社交和招聘。它在找到PMF之前就迅速涨用户,融了4900万美元,之后用户大幅流失,公司只好转型。
- PMF能让你早早看出市场会不会买单。比如一个AI聊天机器人上线以来周环比增长50%,80%的用户续订。
- PMF能验证你的竞争优势。比如一项调查显示,40%的新用户是从竞品AI平台转过来的。
- PMF还会带出意料之外的机会。比如这个AI聊天机器人在科技行业的使用不如预期,在体育行业却意外地好。
衡量PMF最关键的指标:留存
看看你的手机,大概装了几十个app,但每天真正在用的只有几个。它们证明了自己的价值,一直给你带来好处,所以才留在你的主屏幕上。这就是为什么留存是衡量产品成败最有力的指标。
评估PMF有很多指标可看,留存是其中最关键的一个。道理很简单:用户觉得有价值,就会一直回来。留存还有两个特点,让它格外有用:
- 用户很少的时候也能看出东西。在评估PMF的阶段,用户量往往不大,又特别需要反馈,留存这时就很有信息量。
- 留存直接关系到增长潜力。好产品会让使用量和收入越来越多,进一步推动增长。
一句话:留存衡量的是有多少用户随着时间推移还在继续用你的产品,它说明产品在持续地交付价值。
留存分析的四个组成部分
- 定义「活跃」。先想清楚,对你的产品来说什么算活跃。对一个AI聊天机器人,开启一次对话就可以算。
- 定义使用频率。用户应该多久用一次你的产品?这因产品而异:聊天工具追求每天用,订旅行的平台可能一个月用一次就算正常。
- 划分时间窗口。分短期(7天)、中期(30到60天)、长期(180天以上)来看用户行为。
- 按cohort分析。把用户按开始使用的时间分组,追踪不同组的留存怎么变化。
留存率的计算公式:
第Y天留存率 = 第Y天仍活跃的用户数 ÷ 这个cohort的初始用户数
举个例子。2022年元旦你上线了一个新app,第一天来了100个用户。到1月8日,看板显示其中20个人那天还在用。那么这个cohort的第7天日活留存率就是20%(20 ÷ 100)。这个简单的数,能告诉你app在用户第一周之后留得住多少人。
留存曲线的三种形态
用户刚发现你的产品时,有人会留下,有人会慢慢走掉。把留存的用户比例随时间画出来,就是留存曲线。对面向消费者(B2C)的产品,这条曲线通常是这样的:一开始急剧下降,随便看看的人走了;然后曲线开始变平,真正觉得产品有价值的人留了下来。
💡 留存曲线没有统一的标准形状,产品类型不同、服务的人群不同,曲线可能长得很不一样。
不管按天、按周还是按月画,这张图告诉你的不只是数字,还有人们怎么用你的产品,以及你做的东西能不能长久。
理想情况:微笑曲线。最上面那条线,是每个产品团队的梦想:用户不仅留下来,一些走了的人还会回来,曲线末端往上翘。这种「微笑」很少见,通常只出现在成了用户离不开的工具的那类产品上。
健康的现实:平台期。中间那条线,代表一个健康、可持续的产品。开头下降是因为随便看看的人走了,但有一批核心用户找到了持久的价值,一直在用。大多数成功产品的目标就是这条线。
危险信号:一路下滑。如果你的留存像最下面那条线一样一直往下掉,就该先停下增长动作,把精力放在修好产品的核心价值上。
怎么读cohort表
要准确追踪这些形态,用cohort表。它让你比较同一时间开始用产品的用户组,留存是怎么变的。cohort分析需要一定的用户量才有意义,而且它揭示的是趋势,不是统计上的定论。
一张cohort表可以从三个方向读,每个方向讲的是不同的故事。
横着读:看一组用户随时间怎么变。比如5月18日这组用户,如果他们在第五周之后参与度异常地高,说明最近的某个改动(也许是新功能,也许是一次改进)打动了他们。
竖着读:看产品怎么随时间进化。每一行是不同周开始用产品的一组用户。理想情况下,产品在改进,越新的用户组应该留得越久。
看数据:从第三周开始,规律很清楚,每组新用户的留存都比上一组好,说明产品改进起作用了。但7月6日之后加入的用户留存意外下滑,这就是一个该去查的信号:是功能改动,还是bug?弄清这次下滑,才能找回势头。
斜着读:看某个具体日期发生了什么。比如8月17日出现了一个异常:几乎每一组用户,不管哪天开始用的,参与度都突然下降。这种所有人同时受影响的规律,通常意味着那天发生了一件事:可能是线上出了技术故障,也可能是某个重要市场出了外部状况。斜着读能逼你去问这些问题,然后改进和应对。
我的留存够好吗
产品上线以后,你大概会问:我们走对了吗?留存就是产品的成绩单,告诉你用户是不是在你做的东西里找到了真实的价值。
就像医生体检要看好几项生命体征,判断留存「够不够好」也要看几个方面:
- 先自查。跟自己的过去比:新的用户组是不是比早期的留得更久?这说明团队有没有在学习和改进。
- 再找参照。跟你所在领域的同类产品比。比如你在做AI聊天机器人,就拿成熟的客服消息类app的留存来对照,这能告诉你在你的市场里,「好」大概是什么样。
留存上常见的四个坑
下面是四位产品经理用惨痛代价换来的教训:
- Sarah直接照搬了Netflix公开过的留存指标,觉得「对他们有用,对我们也有用」。很快她就发现,她的冥想app和社交、媒体产品的使用规律完全不同:一周冥想一次的用户就可以算很投入,而媒体产品的常态是每天用。
- Mike很得意,他的产品短期留存20%,超过了竞品的15%。但他忽略了一个关键细节:他们团队按登录算留存,竞品按真正使用功能算。
- Alex以为拿到PMF就能松口气了:「留存这么好,现在可以专心做增长了!」半年后她震惊地发现,留存大跌,因为用户从早期的技术尝鲜者变成了大众用户。
- Jamie想用留存来快速决定新功能要不要上,结果很快明白:留存是滞后指标,改动的真实影响要好几周才看得出来,不适合快速实验。
这四个故事对应四个要避开的坑:
- 别照搬别人的指标。你的产品有自己的特点,留存框架要量身定做。
- 比较留存要小心。口径不同,结论就可能是误导。
- 拿到PMF之后也要继续盯。用户群和产品都会变。
- 记住留存是滞后的。快速决策要靠别的指标,留存讲的是更长的故事。
案例:切水果手游
设想一个正在开发的手游:水果和蔬菜从天上掉下来,玩家滑动屏幕去切,切中就得分。玩法简单、上手快,可能很上瘾。可团队怎么确定,自己做的是用户真正想要的东西?
留存是PMF最强的信号之一,所以团队把它当作重点。在看数据之前,先把衡量框架定清楚。
先定衡量框架
- 什么算活跃:玩够10秒。这个门槛能把真玩家和误点打开的人分开。
- 使用频率:每一关只要几分钟,目标是每天都玩,符合休闲游戏的规律。
- 看哪几个时间点:
- 第7天:玩家第一周之后还回来吗?
- 第60天:游戏成了他们固定的娱乐了吗?
- 第180天:游戏能长期提供乐趣吗?
框架定好,团队就可以追踪游戏留不留得住玩家了。
留存曲线
数据显示出三个阶段:
- 开头很投入:头几周玩家在积极探索游戏。
- 中期下滑:新鲜期过后,参与度明显下降。
- 长期流失:活跃玩家在更长的时间里大幅减少。分析发现,玩家往往玩到某一关就不玩了,而那一关正是游戏的最后一关。
按cohort看短、中、长期留存的时间序列,没有发现令人担心的趋势:长期留存低,并不只是最近的玩家才这样。规律很清楚:玩家通关最后一关以后,就不再玩了。就像读完一本好看的书,没有新内容了,自然就放下了。
产品优化的机会
13到18岁的玩家留存明显低于其他年龄段。用户研究发现,这些年轻玩家对苹果、西瓜这些传统水果没感觉,他们更喜欢影视作品和网红带火的虚构水果和食物。
按国家看留存,亚洲的留存明显偏低。用户研究发现,游戏里的水果对亚洲玩家来说很陌生。把各地流行的本地水果加进游戏后,玩家对玩法更有共鸣,留存和增长都上去了。
解决办法
团队从讲故事里找灵感:就像新的章节能让一本书重新好看起来,他们做了一批有主题的新关卡来留住玩家。在亚洲市场加入本地流行的水果,让玩家一眼认出来;水果还会跟着热门话题和季节轮换,保持新鲜感。再配上有针对性的游戏内推送,吸引玩家回来体验这些按文化定制的新内容。
结果
效果很好。追踪各cohort的J形曲线可以清楚看到,玩家回来玩这些新关卡,游戏重新活了过来。
留存太慢,就用领先指标
你上线了一个新功能,等着看用户反应。传统做法是看长期留存,比如180天后还有谁在用。问题是等这么久,可能已经错过了改进或转向的关键时机。
这时就要看「激活」(activation)。把它当作预警系统:就像医生能从生命体征预判健康风险,团队也能从用户早期的特定行为,预测他们会不会长期留下。
不必等180天,而是盯住用户在头两周里做没做某些事。这些早期信号能告诉我们方向对不对,让决策更快、更有依据。
这个方法不只用于留存。类似的早期指标还能预测别的结果,比如一个用户转成付费用户的可能性。
选早期信号,要看三个性质:
- 可预测:像天气预报一样,能准确预测未来的行为。
- 可测量:变化要能很快被发现,做实验时尤其重要。
- 简单:团队里每个人都明白量的是什么、为什么量。
找到预示长期成功的领先指标
假设你在做一个视频流媒体app,你发现第一周看了超过十分钟视频的用户,更可能成为长期用户。这就是一个领先指标(leading indicator),一个预示未来成功的早期信号。Facebook早年发现,新用户在头10天里加到7个好友,就更可能留下来。这样的「aha moment」,是理解产品为什么成功的关键。
要找到这些关键时刻,先定两件事:
- 看什么行为。先挑出可能预示成功的行为。对视频app来说,可以是观看时长、看了几个视频、单次观看多久。
- 在多长的窗口里看。如果营销需要快速反馈,就看第一天的行为;想看更深的投入,就用七天窗口。
两件事定好,就能写出具体的候选指标,比如「头七天看视频超过十分钟的用户」。
但候选指标的价值并不相同。要挑出最好的,用F1分数。它平衡两件事:
- 精确率(precision):满足这个条件的用户里,有多少人后来真的留了下来;
- 召回率(recall):真正留下来的用户里,有多少人满足这个条件。
可以把它理解成,在「标准太严」和「标准太松」之间找到最合适的点。
F1 = 2 × 精确率 × 召回率 ÷(精确率 + 召回率)
其中,精确率 = TP ÷(TP + FP),召回率 = TP ÷(TP + FN)。TP是真阳性:指标说会留、也真的留了;FP是假阳性:指标说会留、其实走了;FN是假阴性:指标没选中、其实留了。
算出每个候选指标的精确率和召回率,画在一张图上:
- 横轴是精确率:越高,说明这个指标挑出的人里,真长期用户越多;
- 纵轴是召回率:越高,说明真长期用户被这个指标覆盖得越全。
图上的点会呈现精确率和召回率的取舍:通常一个高了,另一个就低了。最理想的指标在右上角,两个都高。这张图帮团队在「太严」(精确率高、召回率低)和「太松」(精确率低、召回率高)之间找平衡。
另一个办法是用机器学习模型,比如决策树,或者带L1正则(也叫LASSO)的逻辑回归,找出和留存强相关的候选。比如用决策树时,如果第一次分裂发生在「头七天看了超过十个视频」,这个指标就是留存最好的预测因子。
可测量性
可测量性看的是:指标发生有意义的变化,要多久才能在统计上测出来。做法是用你的实际流量(全量或一半流量),算出在实验里测出某个百分比变化需要多少天。用标准的t检验样本量公式,或者R、Python里现成的样本量计算包就能算。比如一个指标要一个月才能测出20%的变化,就该换掉它:更小的变化要测更久,会拖慢决策。
把可预测性和可测量性放在一起看
算完每个候选的F1分数和测出显著变化需要的天数,把它们画在一张图上,每个点是一个候选指标。这张图能帮你找到可预测性和可测量性组合最好的指标。
如果几个指标的F1和可测量性差不多,就要靠主观判断了。通常,最好的领先指标是最简单的那个:一个动作的指标够用,就别选三个动作的。
一个提醒
领先指标和长期留存的关系会随时间变化。用户群变了,或者给新用户上了新功能,都可能让原来的指标不再灵。所以要持续盯着这些指标的可预测性和可测量性,至少每年重新评估一次。
案例:给视频app找领先指标
来看一个真实的用法。你是一个视频流媒体app的数据科学家,产品经理请你做一个用来看实验的指标,要求它和长期留存强相关。
按前面说的标准,你提出了几组候选指标,算出了它们的精确率、召回率和F1分数(表2-1)。数据显示出精确率和召回率之间有意思的取舍。
候选指标分三类,都看用户头七天的行为:
- ActiveHour_Day7_LongerThan_X:头七天活跃时长是否超过X小时;
- NumberOfVideo_Day7_MoreThan_X:头七天看的视频是否超过X个;
- LongestVideoMin_Day7_LongerThan_X:头七天里有没有一个视频看了超过X分钟。
每类指标用了不同的门槛X,看哪个投入程度最能预测留存。
| 指标 | 精确率 | 召回率 | F1分数 |
|---|---|---|---|
| ActiveHour_Day7_LongerThan_1 | 0.60 | 0.75 | 0.667 |
| ActiveHour_Day7_LongerThan_2 | 0.70 | 0.65 | 0.674 |
| ActiveHour_Day7_LongerThan_3 | 0.90 | 0.10 | 0.180 |
| NumberOfVideo_Day7_MoreThan_1 | 0.50 | 0.85 | 0.630 |
| NumberOfVideo_Day7_MoreThan_2 | 0.55 | 0.75 | 0.635 |
| NumberOfVideo_Day7_MoreThan_3 | 0.65 | 0.45 | 0.532 |
| LongestVideoMin_Day7_LongerThan_10 | 0.40 | 0.55 | 0.463 |
| LongestVideoMin_Day7_LongerThan_20 | 0.63 | 0.46 | 0.532 |
| LongestVideoMin_Day7_LongerThan_30 | 0.70 | 0.34 | 0.458 |
| LongestVideoMin_Day7_LongerThan_60 | 0.85 | 0.25 | 0.386 |
表2-1 头脑风暴出来的候选指标
把这些点画出来可以看到:注册后头七天观看超过两小时,精确率和召回率的平衡最好。
还要看这个指标能不能在实验里足够快地测出来。把F1分数和功效分析(power analysis)的结果画在一起:功效分析告诉你,要测出指标10%的变化需要多少样本,再除以每周的用户流量,就得到需要观察多少天。在这个例子里,测出10%的变化只要一周多,放进标准的两周实验窗口里正好。所以它很适合用来衡量改动对用户的长期影响。
本章要点
LinkedIn这样的公司一直把留存放在核心位置。他们专门看用户半年后还回不回来,在节奏很快的科技行业,这已经是很长的时间了。理由很清楚:半年后还在用的人,多半是真的觉得这个平台有价值。
留存为什么这么有用?第一,它简单。不管跟同事还是投资人讨论,大家都明白最根本的问题:用户还回不回来?第二,它能告诉你产品表现的历史。看不同用户组随时间的留存曲线,就能判断产品改动有没有带来实质的变化。
- 要把留存量好,需要三样东西:
- 对你的产品来说,什么算「活跃」,定义清楚;
- 用户自然的使用频率是多少;
- 在哪个时间段里衡量。
- 留存在三件事上帮你:
- 它是PMF的有力信号,告诉你做的东西是不是大家普遍想要的;
- 它能找出哪些用户最看重你的产品,帮你找到更多类似的人;
- 它能指出哪些用户行为带来长期忠诚,告诉你该推广什么。
- 但留存有一个局限:它是后视镜。所以积极的团队还会追踪能预测留存的早期信号。把这些领先指标当作产品的生命体征,在问题变大之前就发现它们。
练习:手游的领先指标
你是一家手游公司的数据科学家,游戏免费,靠游戏内购买赚钱。下面是2024年1月安装游戏的几位用户的数据:
| 用户ID | 第一周玩的局数 | 第一周游戏时长 | 第一周内购金额 | 第30天是否留存 |
|---|---|---|---|---|
| 1001 | 25 | 180分钟 | $0 | 是 |
| 1002 | 5 | 30分钟 | $0 | 否 |
| 1003 | 15 | 120分钟 | $4.99 | 是 |
| 1004 | 30 | 240分钟 | $9.99 | 是 |
| 1005 | 3 | 15分钟 | $0 | 否 |
表2-2 游戏用户指标
问题1:下面三个候选领先指标,精确率和召回率各是多少?
- 第一周玩超过10局;
- 第一周玩超过60分钟;
- 第一周有过任何内购。
问题2:哪个指标的F1分数最高?
问题3:根据结果,你会推荐哪个指标作为这款游戏的领先指标?
答案
问题1:
- 玩超过10局:满足条件的3个人都留下了,精确率 = 3/3 = 1.00;留下的3个人都满足条件,召回率 = 3/3 = 1.00;F1 = 2 × 1.00 × 1.00 ÷(1.00 + 1.00)= 1.00。
- 玩超过60分钟:同样是那3个人,精确率 = 1.00,召回率 = 1.00,F1 = 1.00。
- 有过内购:有内购的2个人都留下了,精确率 = 2/2 = 1.00;留下的3个人里只有2个有内购,召回率 = 2/3 ≈ 0.67;F1 = 2 × 1.00 × 0.67 ÷(1.00 + 0.67)≈ 0.80。
问题2:「玩超过10局」和「玩超过60分钟」并列最高,F1都是1.00。
问题3:推荐用「玩超过10局」,因为:
- 在这组样本里,它的精确率和召回率都最好;
- 局数比时长更容易量;
- 产品团队更容易围绕「多玩几局」去设计功能,它更能落到行动上。
注释
Analytics at Meta,「Analytics and Product-Market Fit」,Medium,2022年9月7日,https://medium.com/@AnalyticsAtMeta/analytics-and-product-market-fit-11efaea403cd。↩︎
下载整本书
Growth Data Analytics Playbook 中文版,免费下载。