激活与留存:第一次就翻车的用户,第 4 周留存 0%
三张表把"用户为什么不回来"摊开——顺便测出你的 aha 门槛
AP4 和 AP5 花了十三节讲质量:幻觉、检索、评测、门禁。这一节告诉你那十三节到底换来了什么。
首次体验成功(1789 人) 首周平均用量 6.1 次 次周留存 38.7% 第4周留存 8.4%
首次体验翻车( 611 人) 首周平均用量 2.4 次 次周留存 12.9% 第4周留存 0.0%
第一次体验翻车的用户,第 4 周留存是 0%。
不是"低一点",是归零。他们不会给你第二次机会,你后面所有的增长手段都追不回他们。
幻觉率、答非所问、超时——这些从来不是"质量问题",是"留存问题"。
第一次去的餐馆上错了菜,你还会去第二次吗?
大部分人不会,而且他们不会投诉,只是不再来。餐馆老板永远看不到这批人——除非他去数"来过一次就没再来的人有多少"。
这一节就是教你数这个。
表一:留存队列——横着看流失,竖着看改进
批次 W0 W1 W2 W3 W4
第1批 100.0% 32.0% 15.8% 9.7% 5.8% (600 人)
第2批 100.0% 29.8% 13.3% 8.2% 5.5% (600 人)
第3批 100.0% 33.3% 15.2% 9.8% 6.2% (600 人)
第4批 100.0% 33.3% 13.7% 9.2% 7.5% (600 人)
两种读法:
- 横着读:这批人是怎么流失的。W0 → W1 是最陡的一段——大多数产品一半以上的流失发生在第一周。所以激活比留存更值得先做。
- 竖着读:同一列(比如 W1)在不同批次之间有没有变好。这是判断"产品改动有没有用"的唯一可靠方法——因为不同批次的用户是可比的,而总留存率会被新用户涌入稀释。
做队列表的两条纪律:① 按"注册周"分批,不是按日历周;② 别看总留存率,它会骗你(涨了可能只是新用户多了)。
表二:测出你的 aha 门槛
首周使用次数 人数 次周留存
1-1 次 691 12.6%
2-2 次 337 15.7%
3-4 次 490 27.6% ← 跳升
5-7 次 402 41.3% ← 跳升
8-12 次 269 60.6% ← 跳升
13 次以上 211 79.1% ← 跳升
这就是 ap8.2 说的那个数。这批数据里,从 2 次到 3-4 次是第一个明显的台阶(15.7% → 27.6%),之后持续攀升。
读这张表的三个注意:
① 相关不等于因果。"用得多的人留存高"很可能是因为他们本来就更需要你,而不是"多用几次就会爱上"。所以别急着得出"逼用户多用几次"的结论。
② 但它仍然是有用的行动指引:免费额度至少要给到那个台阶(ap8.2 实测:低于 aha 门槛转化归零),新手引导要保证用户在第一周达到那个次数。
③ 想验证因果,做实验。用 ap7.5 的分流,给一组用户更强的引导(推动他们多用几次),看留存差异——这才是因果证据。
表三:第一次体验决定一切
首次体验成功(1789 人) 首周平均用量 6.1 次 次周留存 38.7% 第4周留存 8.4%
首次体验翻车( 611 人) 首周平均用量 2.4 次 次周留存 12.9% 第4周留存 0.0%
翻车的定义要具体,而且你的日志里已经有了:
| 翻车类型 | 数据来源 |
|---|---|
| 回答含幻觉 / 引用核验不通过 | ap5.4 / ap4.6 |
| 结构化输出解析失败 | ap3.2 / ap7.4 的 business_ok |
| 超时或走了降级链路 | ap6.1 的 degraded |
| 被审核拦截(误伤) | ap6.3 的 moderation |
| 用户立刻重问 / 点了踩 | ap5.6 的回流信号 |
把这些标记打在"用户的第一次会话"上,你就能算出这张表。它是把工程质量和商业结果连起来的那根线。
激活:让第一次一定成功
既然第一次这么重要,就别让它随机发生:
第 ② 条值得展开:很多产品对新用户和老用户一视同仁地做成本优化——这是算错了账。ap8.1 算过:一个免费用户整月的服务成本才几分钱,而一个新用户的第一次体验决定了他会不会成为那 3% 的付费用户。在第一次上省钱,是本课最不划算的优化。
留存:AI 产品特有的三个杀手
| 杀手 | 表现 | 对策 |
|---|---|---|
| 一次性需求 | 用户来是为了解决一个具体问题,解决完就走 | 找到高频场景;或者接受它,把重心放在获客效率 |
| 没有触发点 | 用户想不起来还有你 | 建立"什么时候该用你"的联系(邮件/推送/融入工作流) |
| 质量波动 | 这次很好,下次很差 | 这是 AP5 的活——门禁 + 回流,让质量只升不降 |
第三条最容易被低估:用户对"稳定的一般"的容忍度,远高于"忽好忽坏"。一次糟糕的体验能抵消五次好的——所以 ap5.5 的门禁不只是工程纪律,它是留存工具。
🔧 动手做:做出你的三张表(25 分钟)
- 跑本节代码,看懂三张表的结构,然后把
gen_logs()换成你自己的流水查询。 - 做队列表:按注册周分批,算 W0-W4 留存。看 W1 那一列——它是你最该改的地方。
- 测 aha 门槛:按首周使用次数分桶看次周留存,找台阶。把这个数带回 ap8.2 定额度。
- 算首次体验表:定义好"翻车"(用上面那张表的五个数据源),算出两组的留存差。
- 设计第一次会话:示例、最好配置、兜底、下一步、
first_session_ok埋点。 - 定三个北极星指标:激活率(达到 aha 门槛的新用户比例)、W1 留存、首次体验成功率。
✅ 做到这里你应该有:队列表 + aha 门槛 + 首次体验对留存的影响 + 一套新手首次会话设计 + 三个指标。
为什么:这一节是全课的价值闭环。
AP1 让你的调用不崩、AP2-AP3 让输出可靠、AP4 让它有依据、AP5 让质量只升不降、AP6 让它安全、AP7 让它上线——这一切最终兑现在这张表上:第一次体验成功的用户第 4 周留存 8.4%,翻车的 0%。
质量不是给工程师的自我要求,它就是增长本身。
表二显示首周用 13 次以上的人次周留存 79%,用 1 次的只有 12.6%。很诱人的结论是:想办法让每个人都用够 13 次。
但因果很可能是反的:那些人留存高,是因为他们本来就有强需求——多用是结果,不是原因。对着一个本来就不需要你的用户狂发推送逼他用够次数,只会让他更快卸载。
正确的用法有两个:① 作为门槛参考(免费额度别低于那个台阶,新手引导目标定在那里);② 作为分层依据(首周用量低的用户,和用量高的用户,该用完全不同的运营动作)。
想要因果证据,只能做实验:用 ap7.5 的分流,一组给更强的引导,看两组留存差多少。这门课教了你怎么做实验(AP5)、怎么分流(ap7.5)、怎么看噪声(ap2.5)——在商业问题上,它们同样适用。
我的流水表结构是【贴出字段】。请帮我写 SQL/Python:1) 按注册周分批的留存队列表(W0-W8);2) 按首周使用次数分桶的次周留存表,用来找 aha 门槛;3) 首次会话质量(我的失败标记字段是【列出:解析失败/降级/审核拦截/用户点踩/立刻重问】)对 W1 和 W4 留存的影响;4) 基于这三张表,给我一份诊断:我该先修激活还是先修留存,依据是什么;5) 建议我盯的 3 个北极星指标和它们的目标值。
留存三句话:W0→W1 最陡,激活优先于留存、aha 门槛用「首周次数分桶看次周留存」测出来(注意相关≠因果)、第一次体验翻车的用户第 4 周留存 0%——质量就是增长。
一条具体建议:新用户的第一次调用走最好的配置,别省那几分钱。
下一节是 AP8 的收口:定价与套餐——ap8.1 说定价是最大的杠杆,那到底该收多少。
🔎 来源与核验· 3 条,点开核对
