为什么平均值会骗你?AI 产品经理必懂 Token 的 P50/P90/P95
设计AI产品积分体系时,新用户该送多少积分?研发说“平均一个任务消耗5万Token”,但真实数据却显示一半任务不到1.2万。平均值被长尾任务拉高,P50、P90、P95才是关键。本文用真实案例拆解AI产品指标统计的陷阱,教你如何用分位数做决策。

最近我们在给一款政务场景的 AI 办公助手设计积分体系,它类似 Codex、千问办公这类产品。
用户获得积分,执行 Agent 任务,后台根据Token 消耗扣分。第一个问题就是:新用户应该送多少积分?
假设希望初始积分够用户正常跑 40~60 个任务,那就得先知道:一个任务到底消耗多少 Token?
我去问研发。
“大概平均 5 万 Token。”
按这个数字算很简单:1 万 Token = 1 积分,一个任务约 5 积分,发 200 积分,大概可以跑 40 个任务。
方案好像马上就出来了。但我越想越觉得不对。
“平均 5 万”,真的能代表一个正常任务吗?
平均值可能和“正常情况”差的很远
我翻了最近几百个 Session 的数据,大概是:

问题一下就出来了。平均消耗接近 4 万,但实际上有一半任务连 1.2 万 Token 都不到。
为什么?因为 Agent 任务的消耗差异非常大。
有的两三轮就结束,只消耗一万多个 Token;有的会不断读取文件、调用工具、追加上下文,甚至重复调用,最后可能烧掉十几万 Token。
少数特别重的任务,会把平均数明显拉高。
举个最简单的例子:
1、1、1、1、96
平均值是 20,但正常情况明显更接近 1
但如果问“一个典型任务是什么水平”,答案显然更接近 1,而不是 20。
平均值看的是总体,代表不了大多数任务。

这时候就要看 P 值。
P50、P90、P95 到底是什么?
其实说穿了很简单:把所有任务的 Token 消耗从低到高排成一排。
- P50:站在第 50 个位置的那个数——一半任务比它少,一半比它多。说白了,就是中位数。
- P75:75% 的任务不超过它,大部分任务大概就在这个范围里。
- P90:90% 的任务不超过它,从这里开始能看到比较重的任务。
- P95:95% 的任务不超过它,基本到最重的那批了。
- P99:再往上看还有 P99,专门用来盯特别极端的——比如 Agent 死循环、疯狂重试这种。
一句话
P 值回答的就是——有多少比例的任务,没超过这个数?

计算也不复杂,数据排序后找对应位置就行。100 个任务看 P90,就是大约第 90 个位置上的数。
踩坑提示 唯一要留个心眼:Excel、Python、SQL 算出来的结果可能差一点点,因为插值方式不同。团队定一个口径就行。
为什么 AI 产品特别需要看这些指标?
因为 AI 产品里的指标,天然都带长尾。
Token 消耗是,任务耗时也是,响应时间、工具调用次数、单任务成本,全都一个德行。
可能大多数任务 30 秒就结束,少数重任务却跑了 5 分钟。你要只看平均数——
“平均 50 秒”——数字没错,但用户真正经历的差异,全被藏起来了。
所以这几个数各回答各的问题:
- 平均值:回答“整体什么水平”。
- P50:回答“一个典型任务什么样”。
- P90 / P95:回答“长尾已经重到什么程度”。
P99 再往上,专门用来抓特别极端的情况——死循环、重复调用工具、异常重试。
那积分方案到底应该看哪个?
这里最容易走另一个极端:既然平均值会骗人,那是不是以后全看 P50?
也不是。指标本身不是答案,它只是帮我把决策做出来。
回到积分方案,我最后是这么用的:
- P50:典型任务多重
- P90 / P95:复杂任务会不会烧光积分
- 平均值:平台一天烧多少成本
一句话
平均值管总账,P50 管典型任务,P90/P95 管长尾风险。

至于最后发 200 还是 300 积分,还得看用户实际任务频次、想让用户爽几次、成本预算扛不扛得住。
还有一个比 P 值更重要的问题:统计口径
我后来又发现一个坑。
最开始拿到这组 Token 数据时,我以为可以直接拿来设计积分了。
仔细看日志才发现,这份数据甚至不一定是最终的计费口径。
平均值可能算对了,P50、P90、P95 也可能全算对了——但如果统计的根本不是你想要的指标,后面全是白算。
所以现在再有人跟我说“平均一个任务消耗 5 万 Token”,我会连着问:
- 这个 Token 是什么口径?
- 统计单位是一次调用、一个任务,还是一个 Session?
- 有没有包含历史上下文和工具调用?
- 里面有没有测试数据和异常任务?
这些问题,数字本身不会回答。
写在最后
做 AI 产品,看到“平均值”时,我现在会本能地再问一句:
分布长什么样?中位数是多少?长尾有多长?
P50、P75、P90、P95、P99……选哪个不是拍脑袋,取决于你想兜住多少人:定价看典型,风控看长尾。
然后再问一句:这个数字到底是怎么算出来的?
本文由 @产品不正经 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议

起点课堂会员权益





积分场景确实是分位数最该发挥作用的地方。平均值会让人觉得“发200积分就能跑40个任务”,但真实用户可能做了5个重任务就烧光,体验直接崩。用P50定典型、P90/P95兜底长尾,这套逻辑不仅能用在积分上,做AI功能定价和资源配额也能直接平移。