单位经济模型:算完这笔账,你会发现省 token 不是重点
五个杠杆的敏感性实测——定价影响 5220 元,单次成本只影响 265 元
AP1 花了六节教你省钱:缓存、并发、模型选型、成本仪表。这一节要给那六节一个新的位置。
同一个产品模型,五个杠杆各动 ±30%:
杠杆 -30% 时利润 +30% 时利润 影响幅度
定价 3109 元 8329 元 5220 元
付费转化率 3133 元 8305 元 5171 元
月活 3403 元 8035 元 4631 元
人均用量 6013 元 5425 元 589 元
单次成本 5984 元 5719 元 265 元
定价动 30%,利润差 5220 元;单次调用成本动 30%,利润差 265 元——差了 20 倍。
这不是说 AP1 白学了。成本优化是防守(防止它失控吃掉你),增长杠杆在收入端。这一节教你怎么把这两件事放在正确的位置上。
开餐馆的人都知道:食材成本要控,但决定你赚不赚钱的是翻台率和客单价。
一个只盯着"这个月土豆便宜了两毛"的老板,和一个在琢磨"怎么让客人愿意多点一道菜"的老板,一年后的差距不是两毛钱的问题。
一、先把账列出来
【基线:没做缓存】
收入 8700 元 变动成本 981 元 固定 2000 元 → 利润 5719 元
毛利率 88.7% ARPU 0.87 元/人 服务成本 0.098 元/人 付费用户 300 人
【启用前缀缓存(命中 70%)】
收入 8700 元 变动成本 363 元 固定 2000 元 → 利润 6337 元
毛利率 95.8% ARPU 0.87 元/人 服务成本 0.036 元/人
假设:月活 10000、人均每月 30 次调用、单次 0.003 元、付费率 3%、月费 29 元、固定成本 2000 元。换成你自己的数字重跑一遍,这是这一节的重点。
四个必须算出来的数:
| 指标 | 含义 | 本例 |
|---|---|---|
| 单用户服务成本 | 变动成本 ÷ 月活 | 0.036 元 |
| ARPU | 收入 ÷ 月活(不是 ÷ 付费用户) | 0.87 元 |
| 毛利率 | (收入 - 变动成本) ÷ 收入 | 95.8% |
| 回本能力 | 一个付费用户能养活几个免费用户 | 867 个 |
二、最重要的一个数:一个付费用户能养活几个免费用户
一个免费用户每月服务成本 = 0.03 元(缓存 70% 后)
一个付费用户每月贡献 = 28.87 元
→ 每 1 个付费用户,能养活 867 个免费用户
这个数字直接决定你的产品策略:
- 它大(几百以上):免费额度可以给得很松,用免费换增长是划算的(ap8.2);
- 它小(个位数):每个免费用户都在真金白银地烧钱,必须尽早收窄免费额度,或者干脆不做免费。
大模型应用大多落在"它很大"这一侧——因为文本推理便宜。这和很多人的直觉相反:大家觉得"AI 很贵",但对文本类应用来说,贵的是获客,不是推理。
反例要认:如果你的产品是长文档处理、多轮长上下文、图像/视频生成、或者每次要跑多轮智能体——单次成本可能是这里的几十上百倍,这个数会小得多。所以必须用你自己的数字算,别抄结论。
三、敏感性:哪个杠杆值得你花时间
定价 影响 5220 元
付费转化率 影响 5171 元
月活 影响 4631 元
人均用量 影响 589 元
单次成本 影响 265 元
三条结论:
① 收入端的三个杠杆(定价、转化、月活)比成本端大一个数量级。如果你有一周时间,花在"怎么提高转化"上的回报,远高于"怎么再省 20% token"。
② 成本优化的意义是"防守"而不是"进攻"。它防的是两种情况:
- 被刷(ap6.4 实测:一个用户吃掉 85% 账单);
- 规模化后失控(月活涨 100 倍时,0.098 元和 0.036 元的差别就变成了几万块)。
③ "人均用量"是个反直觉的杠杆:注意它是负向的——人均用量涨 30%,利润反而略降(6013 → 5425)。因为在免费为主的结构里,用得多的主要是免费用户,他们只增加成本不增加收入。
这不代表要限制用户使用——恰恰相反,它说明你的免费和付费的界限没设计好(下一节的主题)。
四、用量分布决定你的计费方式
10000 个用户本月共调用 283449 次,人均 28.3 次,中位数 13 次
用量最高的 1% 用户( 100 人)占了总调用量的 13.9%
用量最高的 5% 用户( 500 人)占了总调用量的 35.4%
用量最高的 10% 用户(1000 人)占了总调用量的 49.7%
用量最高的 20% 用户(2000 人)占了总调用量的 67.0%
注意"人均 28.3 次"和"中位数 13 次"的差距——又是 ap7.4 那个道理:平均值被少数重度用户拉高了,它不代表典型用户。
这个分布直接决定计费设计:
| 计费方式 | 问题 |
|---|---|
| 纯包月 | 被重度用户拖垮(10% 的人用掉一半资源) |
| 纯按量 | 吓跑轻度用户(中位数用户一个月只用 13 次,他没法预估自己要花多少钱) |
| 包月含额度 + 超出按量 | ✅ 常见解法,额度线画在 P90 附近——90% 的人感觉是"包月无限用",10% 的重度用户按量补差 |
还有一个安全提醒:这批重度用户和 ap6.4 里的"滥用者"在数据上长得很像。你的系统要能区分"真爱"和"脚本"——前者该被珍惜甚至引导付费,后者该被限流。区分方法:看行为模式(时间分布是否规律得像机器)、看内容多样性、看是否有正常的交互路径。
🔧 动手做:算你自己的账(20 分钟)
- 打开本节代码,把顶部的 7 个参数全换成你自己的(没上线就用你的预估,但要写下依据)。
- 跑出四个数:单用户服务成本、ARPU、毛利率、一个付费用户能养活几个免费用户。
- 跑敏感性分析,看你的杠杆排序——它可能和本例不同(重推理产品的成本杠杆会靠前很多)。
- 从 ap1.6 的流水里拉真实用量分布,算出中位数、P90、top10% 占比。别用平均值。
- 回答三个问题并写下来:免费用户在亏钱吗?额度线该画在哪?我该先优化哪一端?
- 设一个"规模化警戒线":月活到多少时,现在这套成本结构会开始难受?
✅ 做到这里你应该有:一份你自己的单位经济模型 + 杠杆排序 + 真实用量分布 + 三个问题的书面答案。
为什么:这一节是从"能做出来"到"能做下去"的分界。前面七章解决的都是工程问题,这一章的问题是:这件事值不值得继续投入。
而最实用的收获可能是那句反直觉的话:大多数人在错误的地方努力——盯着 token 单价省了三天,不如花半天想清楚定价和转化。AP1 那六节不是白学的,它们让你的成本不会失控;但让你活下去的,是这一章。
本节至少三处埋着这个坑:
① 人均调用 28.3 次 vs 中位数 13 次。按平均值设免费额度,你会同时得罪两批人:对典型用户来说额度过松(没有付费动机),对重度用户来说远远不够。
② ARPU 要除以"总用户"而不是"付费用户"。除以付费用户得到的是客单价,两个数意义完全不同:客单价 29 元听起来不错,ARPU 0.87 元才是你真实的每用户价值。
③ 用平均成本估算规模化。成本随规模的变化不是线性的:缓存命中率会随用户量上升(相似问题变多),但重度用户的绝对数量也会上升。要分层建模,别用一个平均数往上乘。
最实用的一条建议:所有商业指标都同时看中位数和 P90。中位数告诉你典型用户,P90 告诉你边界在哪。
我的 AI 产品是【描述】。已知或预估:月活【X】、人均月调用【X】次、单次调用平均消耗【输入 X tok / 输出 X tok】、模型单价【X】、缓存命中率【X%】、固定成本【X 元/月】、计划定价【X 元/月】、预估付费率【X%】。请帮我:1) 算出单用户服务成本、ARPU、毛利率、一个付费用户能养活几个免费用户;2) 对定价/转化/月活/人均用量/单次成本做敏感性分析并排序;3) 指出我这个成本结构下最该先优化的一端;4) 给出规模化警戒线(月活到多少时成本结构会难受);5) 结合我的用量分布建议计费方式(包月/按量/混合,额度线画在哪)。
单位经济三句话:先算四个数(单用户成本、ARPU、毛利率、一个付费用户养活几个免费用户)、收入端杠杆比成本端大一个数量级(5220 vs 265)、用量高度不均(10% 用户占一半),决定你该用「包月含额度 + 超出按量」。
下一节把这个模型用起来:免费额度给多少、付费墙立在哪——给太松没人付费,给太紧没人留下。
🔎 来源与核验· 3 条,点开核对
