为什么平均值会骗你?AI 产品经理必懂 Token 的 P50/P90/P95

1 评论 284 浏览 0 收藏 8 分钟

设计AI产品积分体系时,新用户该送多少积分?研发说“平均一个任务消耗5万Token”,但真实数据却显示一半任务不到1.2万。平均值被长尾任务拉高,P50、P90、P95才是关键。本文用真实案例拆解AI产品指标统计的陷阱,教你如何用分位数做决策。

最近我们在给一款政务场景的 AI 办公助手设计积分体系,它类似 Codex、千问办公这类产品。

用户获得积分,执行 Agent 任务,后台根据Token 消耗扣分。第一个问题就是:新用户应该送多少积分?

假设希望初始积分够用户正常跑 40~60 个任务,那就得先知道:一个任务到底消耗多少 Token?

我去问研发。

“大概平均 5 万 Token。”

按这个数字算很简单:1 万 Token = 1 积分,一个任务约 5 积分,发 200 积分,大概可以跑 40 个任务。

方案好像马上就出来了。但我越想越觉得不对。

“平均 5 万”,真的能代表一个正常任务吗?

平均值可能和“正常情况”差的很远

我翻了最近几百个 Session 的数据,大概是:

问题一下就出来了。平均消耗接近 4 万,但实际上有一半任务连 1.2 万 Token 都不到。

为什么?因为 Agent 任务的消耗差异非常大。

有的两三轮就结束,只消耗一万多个 Token;有的会不断读取文件、调用工具、追加上下文,甚至重复调用,最后可能烧掉十几万 Token。

少数特别重的任务,会把平均数明显拉高。

举个最简单的例子:

1、1、1、1、96

平均值是 20,但正常情况明显更接近 1

但如果问“一个典型任务是什么水平”,答案显然更接近 1,而不是 20。

平均值看的是总体,代表不了大多数任务。

 

 

这时候就要看 P 值。

P50、P90、P95 到底是什么?

其实说穿了很简单:把所有任务的 Token 消耗从低到高排成一排。

  • P50:站在第 50 个位置的那个数——一半任务比它少,一半比它多。说白了,就是中位数。
  • P75:75% 的任务不超过它,大部分任务大概就在这个范围里。
  • P90:90% 的任务不超过它,从这里开始能看到比较重的任务。
  • P95:95% 的任务不超过它,基本到最重的那批了。
  • P99:再往上看还有 P99,专门用来盯特别极端的——比如 Agent 死循环、疯狂重试这种。

一句话

P 值回答的就是——有多少比例的任务,没超过这个数?

计算也不复杂,数据排序后找对应位置就行。100 个任务看 P90,就是大约第 90 个位置上的数。

踩坑提示 唯一要留个心眼:Excel、Python、SQL 算出来的结果可能差一点点,因为插值方式不同。团队定一个口径就行。

为什么 AI 产品特别需要看这些指标?

因为 AI 产品里的指标,天然都带长尾。

Token 消耗是,任务耗时也是,响应时间、工具调用次数、单任务成本,全都一个德行。

可能大多数任务 30 秒就结束,少数重任务却跑了 5 分钟。你要只看平均数——

“平均 50 秒”——数字没错,但用户真正经历的差异,全被藏起来了。

所以这几个数各回答各的问题:

  • 平均值:回答“整体什么水平”。
  • P50:回答“一个典型任务什么样”。
  • P90 / P95:回答“长尾已经重到什么程度”。

P99 再往上,专门用来抓特别极端的情况——死循环、重复调用工具、异常重试。

那积分方案到底应该看哪个?

这里最容易走另一个极端:既然平均值会骗人,那是不是以后全看 P50?

也不是。指标本身不是答案,它只是帮我把决策做出来。

回到积分方案,我最后是这么用的:

  • P50:典型任务多重
  • P90 / P95:复杂任务会不会烧光积分
  • 平均值:平台一天烧多少成本

一句话

平均值管总账,P50 管典型任务,P90/P95 管长尾风险。

至于最后发 200 还是 300 积分,还得看用户实际任务频次、想让用户爽几次、成本预算扛不扛得住。

还有一个比 P 值更重要的问题:统计口径

我后来又发现一个坑。

最开始拿到这组 Token 数据时,我以为可以直接拿来设计积分了。

仔细看日志才发现,这份数据甚至不一定是最终的计费口径。

平均值可能算对了,P50、P90、P95 也可能全算对了——但如果统计的根本不是你想要的指标,后面全是白算。

所以现在再有人跟我说“平均一个任务消耗 5 万 Token”,我会连着问:

  1. 这个 Token 是什么口径?
  2. 统计单位是一次调用、一个任务,还是一个 Session?
  3. 有没有包含历史上下文和工具调用?
  4. 里面有没有测试数据和异常任务?

这些问题,数字本身不会回答。

写在最后

做 AI 产品,看到“平均值”时,我现在会本能地再问一句:

分布长什么样?中位数是多少?长尾有多长?

P50、P75、P90、P95、P99……选哪个不是拍脑袋,取决于你想兜住多少人:定价看典型,风控看长尾。

然后再问一句:这个数字到底是怎么算出来的?

本文由 @产品不正经 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 积分场景确实是分位数最该发挥作用的地方。平均值会让人觉得“发200积分就能跑40个任务”,但真实用户可能做了5个重任务就烧光,体验直接崩。用P50定典型、P90/P95兜底长尾,这套逻辑不仅能用在积分上,做AI功能定价和资源配额也能直接平移。

    来自广东 回复