同一个豆包,两家机构差了1.46亿:AI应用半年考暴露的真问题
6 月豆包月活 5.28 亿创下新高,但换一家机构统计,同一个产品同一个月只有 3.82 亿,差出来的 1.46 亿接近 DeepSeek 一整个产品的月活。这不是谁在造假,是月活这个用了十几年的指标,在 AI 产品身上已经测不准了。本文从这份 AI 应用半年考榜单出发,拆三个失效现场:月活因为 AI 入口寄生在超级 App 里而失真、声量与留存彻底背离、连行业报道自己都在混用两把尺子算增长。再往下追一层会发现,这和我做内容识别项目时踩过的坑是同一件事,离线评测九十几分,上线掉十几个点,根因是评价标准和用户体感不一致。月活、声量、token 调用量,全都是代理指标。文章还梳理了行业在半年内换掉的三把尺子(DAU → TPD → DAA),以及 Gartner 为什么建议弱化 token 指标,最后给出三个能立刻用起来的动作和一张代理指标自查框架。

前几天刷到一份 AI 应用的半年考榜单,新京报 AI 研究院和 Xsignal 联合编的《全媒介之星》。里面有个数字很显眼,豆包 6 月月活 5.28 亿,创了历史新高。
我顺手翻了 QuestMobile 同月的 AI 原生 App 榜。同一个豆包,同一个 6 月,3.82 亿。
两个数字差 1.46 亿。
这不是谁在造假。两家机构的统计口径不一样,算不算 App 内的嵌入式入口、算不算网页端,数字就能差出这么多。但问题恰恰在这里。月活是我们用了十几年、最没有争议的那个指标,它在 AI 产品身上已经测不准了。
而这只是这份半年考暴露的第一件事。

一、三个失效现场
失效一:月活测不准
1.46 亿这个差值到底怎么来的,得看 AI 产品现在长在哪儿。
豆包连着抖音,千问连着淘宝和高德,元宝连着微信。这一代 AI 应用不是独立生长的,它们寄生在已经跑通的超级 App 里。
传统 App 的月活统计逻辑很简单,打开算一次。但当 AI 变成一个嵌在其他产品里的功能入口,你就分不清用户是专程来用 AI 的,还是刷着刷着顺手点了一下。
统计机构必须做取舍,取舍就产生分歧,分歧就变成 1.46 亿。
失效二:声量和月活开始背离
榜单里千问的声量连续三个月排第一,但月活并没有超过豆包。豆包反过来,声量不算高,月活创了新高,榜单原文用的词是低调。
这两件事第一次这么明确地分开了。
更值得看的是元宝。今年春节它是声量最高的那个,腾讯砸了大手笔做红包活动。结果 Xsignal 的数据显示,除夕当天 DAU 冲到 4054 万,到 2 月 23 日剩 768.5 万,跌了 81%,一个月回到活动前的水平。
声量能买到,留存买不到。
失效三:增长数字自己就在打架
写到这儿我本来想引一组数据,元宝月活从 2 月高点的 1.14 亿跌到 6 月的 7900 万,下滑近四成。看起来很有说服力。
翻到出处我发现不对。1.14 亿是腾讯按自身口径披露的,7900 万来自 Xsignal。 也就是说,这个下滑近四成,是拿一把尺子的分子去减另一把尺子的分母算出来的。
我不打算把这段藏起来,因为它恰好是这篇文章想说的那件事本身。一篇严肃的行业分析报道,在举例说明产品衰退的时候,自己都会混用两把尺子而不自知。
真要说元宝的问题,用同源数据更硬:2025 年 3 月它的月活是 4200 万,到 9 月回落到 3286 万。今年春节又来了一次,同一个坑踩了两遍。
二、双寡头格局,把指标失效的代价放大了
再看这份半年考的整体格局。
月活过千万的 AI 应用一共 13 款,字节和阿里旗下占了 7 款。按榜单内各应用月活简单加总,这两家合计约 10.19 亿,占 13 款总和的 74.4%。
阿里是千问加夸克双主力,配上蚂蚁阿福和 Qwen 的多入口矩阵。字节靠豆包一款打穿。其余厂商基本都只有一个核心产品在撑着,DeepSeek 月活 1.65 亿,元宝、Kimi、文心助手在千万到亿级之间。
这个格局对指标意味着什么?
当七成以上的月活集中在两家的超级 App 生态里,月活这个指标衡量的东西就变了。 它测的不再是这个 AI 产品有多好用,而是它挂靠的那个入口有多大流量。
一个日活八亿的 App 给你开一个二级入口,你的月活立刻上亿。这个数字很真实,也确实是用户点进来了,但它没有回答任何一个产品经理真正想知道的问题:这些人有没有在这儿解决掉一个问题,会不会明天还来,愿不愿意为此付钱。

三、我在小得多的尺度上,踩过同一个坑
看到这些数字打架的时候,我第一反应不是分析行业,是想起自己做过的一个内容识别项目。
离线评测的时候,准确率是九十几,那种可以拿出去汇报的水平。上线之后指标掉了十几个点。
说实话当时挺诧异的,离线跑得好好的东西,换成真实用户就崩了。(那几天一直在刷看板,心里还指望是量太小不具代表性,等全量用户上来指标就回去了)
赶紧查,最后定位到的根因不是模型问题,是评价标准和用户体感不一致。
评测集里,标注员按照既定规则做判断,模型学会了这套规则,所以准确率很高。但用户不按规则活。同一条内容,规则判定为正确的,用户觉得就是不对。这个落差没有出现在任何一个离线指标里,因为离线指标从设计的第一天起就是拿规则去对规则。
我们测的从来不是效果,是效果的一个代理。
这个代理在评测集上和真实效果高度相关,所以我们相信它。它一旦离开评测集,相关性就断了,而我们还在拿它做决策。
现在把这句话放大到亿级规模上看今天的榜单,你会发现是同一件事。
月活是代理,声量是代理,token 调用量也是代理。榜单在测的东西和用户真正得到的价值之间,隔着一道和我那个评测集一模一样的沟。区别只在于,我那次的代价是一个项目返工,这次的代价是整个行业的资源配置方向。
四、行业已经换了三把尺子,每一把都被下一把否定
有意思的是,这件事行业内部早就在动了。而且不是换了一次,是短短几个月里连着换了三次。
第一把尺子:DAU。
OpenAI 已经在把主要观测指标从 DAU 转向 TPD,也就是每日 token 消耗量。理由很直接,DAU 能告诉你有多少人打开了 ChatGPT,但它没法告诉你这些人创造了多少价值。
第二把尺子:token 调用量。
火山引擎 6 月披露,豆包日均 token 调用量 180 万亿。这个数字确实比月活更接近真实使用强度。
但它撑了没多久。Gartner 在 3 月发的研究报告里建议 AI 负责人弱化 token 指标,理由同样直接:token 反映的是成本,不是产出。100 万 token 没完成任务,不如 1 万 token 把事办了。
第三把尺子:任务完成。
李彦宏在 5 月提出 DAA,日活跃智能体,衡量的是每天有多少智能体在真实场景里完成了至少一次任务闭环。Gartner 那份报告的建议方向也一致,用解决方案能力、决策有效性、成本可预测性、可量化的业务结果来评估。
三把尺子,半年时间,每一把都被下一把否定掉。
这说明的不是指标在稳步进步。说明的是这个行业到现在还没长出属于自己的度量衡,只能一边跑一边试。 我们今天看到的所

有榜单、所有排名、所有增长曲线,用的都还是移动互联网时代那套尺子,或者是刚打磨到一半的新尺子。
五、所以我们现在该看什么
这个问题目前没有标准答案,但有几个动作可以立刻用起来。
第一,看到任何 AI 产品数据,先问三句话。
谁统计的、算了哪些入口、这个数字对应什么用户行为。这三句话能过滤掉大部分失真信息。文章开头那 1.46 亿的差值,问完第一句和第二句就清楚了。
第二,在自己的产品里,把代理指标和真实价值分开写。
具体做法是列两栏。左栏是你现在汇报用的指标,右栏是你认为的真实价值。然后逐条问自己,这个代理指标在什么条件下会和真实价值脱钩。
我那个内容识别项目的答案是,当用户的判断标准和标注规则不一致时脱钩。今天豆包月活的答案是,当嵌入式入口的流量归属无法拆分时脱钩。
能提前写出脱钩条件的团队,比只盯着数字涨没涨的团队,早半年发现问题。
第三,给关键指标配一个反向验证。
月活涨的时候看留存曲线,调用量涨的时候看任务完成率,声量涨的时候看次日回访。任何一个指标单独看都会骗人,两个方向相反的指标同时看,才能看出真相。
元宝的问题在除夕当天其实就能看出来,只要有人把 DAU 和次日留存放在同一张图上。

这半年的 AI 应用数据看下来,我的结论不是谁赢了谁输了。
是所有人手里的尺子都不太准,而我们还在拿这些尺子做很重要的决定。
融资看月活,立项看排名,绩效看增长。这些数字每一个都是真的,每一个又都不完全是它看起来的那个意思。
那个内容识别项目后来我们重做了评测集,把真实用户的反馈按分布抽样进去,指标降了一大截,但从那以后线上线下的差距就没再超过五个点。这件事花了额外的三周。
行业现在要做的大概是同一件事,只是要花的时间不止三周。
本文由 @楊yang 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益




