豆包月活3.8亿、Kimi月活729万:被吹上神的和被用脚投票的,不是同一个产品
豆包月活断层第一,Kimi口碑爆棚,DeepSeek闷声赚钱——AI助手三巨头,谁才是学生党的真正刚需?本文以学生身份实测一个月,从长文本生成、多轮对话到代码Debug,用真实任务揭穿营销泡沫,告诉你哪个App最值得留在手机里。

2026年8月,QuestMobile上半年榜单出炉:豆包月活3.82亿,断层第一,一家超过第二到第七名的总和。而常年被学术圈捧为”论文神器”的Kimi,月活729万——不到豆包的五十分之一。
更讽刺的是商业化:坐拥3.82亿月活的豆包,上半年单日营收不到百万,多靠电商导流续命;而2026年5月,豆包悄悄上架了最高5088元/年的订阅。另一边,App至今免费的 DeepSeek,靠开发者API做到了年化4-5亿美元营收——并且在8月刚完成一次API涨价。
用户量、营收、口碑,三个维度,三家各拿一个第一。这场仗到底谁赢了?我把三个App都装回来,以学生的身份实打实用了一个月——不是想证明谁更好,而是想搞清楚:当免费红利退潮、营销泡沫散去,作为学生,我到底该把哪个留在手机里。

一、月活不会说谎:Kimi的问题不是不够好,是”信仰没转化为身体”
先看一组扎心的对比:

Kimi的10分钟以上用户占比26.1%,和豆包的27.5%几乎持平——留下来的用户粘性并不差,差的是留不住大众用户。这说明Kimi不是产品烂,是长文本这个场景天然有天花板:论文阅读是低频需求,没人天天读论文。
而DeepSeek的30.0%全场最高,配合1.3亿月活,说明”搜索+推理”的定位吃到了真需求。它被归类为”AI搜索引擎”不是偶然——学生查资料、写代码、debug的场景,DeepSeek确实接得住。



二、实测对比:三个产品,三个性格
我用同一组学生场景的高频任务实测了三款产品,结论先放这里:没有一个能全场景通关,但翻车的姿势各不相同。
任务1:结构化长文本生成
1)测试设置
输入方式:采用标准化模拟输入——向三个模型同步提供《社会心理学》核心知识点文本(涵盖社会思维、社会影响、社会关系三大模块),要求生成Markdown格式的期末复习提纲,并特别要求包含“核心概念定义”、“经典实验举例”及“归因理论vs认知失调对比表格”。
评价维度:格式遵循度、信息完整性、逻辑层级清晰度、易用性(是否可直接用于复习)、响应速度。
2)实测结果对比

3)深度点评
DeepSeek(效率与精炼度最优)
在39秒内给出了结构严谨、信息密度适中的提纲。其对比表格不仅覆盖了归因与失调的“核心研究对象”、“产生前提”、“关键机制”,还单独列出了“相互联系”维度,体现了对知识体系的深层理解。篇幅控制得当,学生可直接打印背诵,无需二次删减。
豆包(内容完整但严重冗长)
耗时1分47秒,输出篇幅极长(用户反馈远超正常复习提纲的体量)。虽然信息覆盖全面,所有要求均有响应,但组织方式偏“堆砌”——大量概念和实验细节平铺直叙,对比表格淹没在长段落中,学生需要花费额外时间自行提炼重点,降低了“提纲”本身应有的快速检索功能。若用于扩展阅读则合适,但作为复习提纲略显累赘。
Kimi(最慢但最详尽,达到“辅导资料”级别)
耗时4分10秒,是DeepSeek的6倍以上,但输出“特别完整”。从用户反馈来看,Kimi给出的提纲不仅覆盖所有知识点,还额外补充了“记忆口诀”、“常见考题角度”等实用内容,结构清晰、层次分明,甚至可替代一本小型复习手册。但过长的等待时间在实测中显著拖累效率,适合对深度有极高要求且不赶时间的场景。
任务2:连续多轮对话修改
1)测试设置
测试方式:三轮连续对话,模拟学生从选题到定稿的迭代修改过程。
第一轮(初始生成) :向三个模型发送指令——“请为《人工智能对会计行业就业影响》这篇课程论文,生成一份500字左右的详细写作大纲。”
第二轮(第一次追问) :“大纲写得太宏观了。请把‘技术冲击’这一章拆解为‘RPA对核算岗’和‘BI对分析岗’两个小节,并补充对应的行业数据(模拟数据即可)作为论据支撑。”
第三轮(第二次追问) :“把语言风格从学术综述调整为‘给政策制定者的内参报告’风格,要求结论部分增加三条具体的政策建议,大纲结构按照‘现状-问题-对策’重组。”
评价维度:上下文记忆能力(是否记得前两轮内容)、指令覆盖完整度(是否同时满足多个修改要求)、修改幅度(迭代感强弱)、产出实用性。
2)实测结果对比
3)深度点评
DeepSeek(指令跟踪最精准)
三轮对话中表现最稳定。第二轮将“技术冲击”精准拆解为RPA与BI两大模块,数据具体到岗位层面;第三轮在主动复述前两轮需求的基础上,完成了风格转换和结构重组,三条政策建议(如“建立会计人员数字素养培训基金”、“修订高校会计课程认证标准”)具体、可落地,完全符合内参报告的“现状→问题→对策”逻辑链条。体现了最强的指令拆解和执行能力。
豆包(修改保守,迭代感弱)
首轮大纲结构基本合理,但第二轮拆解时RPA和BI两部分高度重复(比如都写了“减少重复劳动”),数据也缺乏区分度;第三轮虽然语言上有“内参化”倾向(加入了“亟待重视”等措辞),但大纲骨架几乎未动,仅在第一版基础上填充了少量内容,缺乏实质性的迭代。适合不需要深度修改、只需润色的场景,但在本测试的多轮需求下表现偏弱。
Kimi(细节丰富但关键遗漏)
第二轮表现极佳,拆解和数据补充都很规范(甚至标注了“模拟数据来源”),但第三轮在响应“结构重组”时,把第二轮的RPA和BI具体章节合并成了单一的“技术冲击概述”,丢失了之前已经做好的细化拆解。不过其在政策建议部分非常详细,给出了5条建议且均附有执行主体和时间表。说明Kimi的局部单项能力强,但在多指令并行时出现记忆衰减和优先级误判,未能完整覆盖用户的全部要求。
任务3:代码理解与Debug
1)测试设置
输入方式:向三个模型发送同一段存在多处问题的Python代码,要求“Review代码、解释原本想实现的功能、找出所有Bug、给出修正后的完整代码”。
测试代码(故意设置5处问题):
def process_scores(scores): total = 0 count = 0 for i in range(len(scores)): if scores[i] > 60: total = total + scores[i] count = count + 1 avg = total / count print(“合格平均分是:” + avg) return avg result = process_scores([45, 78, 92, 58, 66, 100])
预设Bug清单(评判标准):
Bug 1:count为0时触发ZeroDivisionError(所有分数均≤60时崩溃)
Bug 2:print中字符串与avg(int/float)用+拼接,触发TypeError
Bug 3:硬编码60分阈值,灵活性差(未作为参数传入)
Bug 4:函数无文档字符串(docstring),可读性差
Bug 5:变量命名不语义化(scores -> score_list 等建议;avg 虽尚可但有改进空间)
2)实测结果对比

3)深度点评
DeepSeek(Bug查全率+工程思维领先)
唯一检出全部5处问题的模型,且优先级排序清晰——先指出导致崩溃的致命Bug(除零、类型拼接),再指出影响可维护性的非致命问题(硬编码、命名、docstring)。修正代码不仅可直接运行,还增加了if not scores的空列表检查,体现了工程级的鲁棒性考量。对于count=0的场景,给出了return 0.0的优雅降级方案。 在本任务中表现断崖式领先。
豆包(修Bug但不彻底)
修正了导致报错的类型拼接和硬编码问题,也补充了docstring,但未发现最隐蔽的除零风险(若及格人数为0,代码仍会崩溃)。此外,修正代码中avg = int(total / count)强行转为整数,丢失了小数精度(如平均分78.6被输出为78),属于修复一个问题却又引入另一个问题。对边界情况的处理意识较弱。
Kimi(发现关键风险,但交付粗糙)
正确指出了除零和类型拼接这两个致命错误,硬编码问题也有提到,但遗漏了docstring和命名规范。最大的问题是修正后的代码存在缩进错误——for循环内部的if语句缩进丢失,用户直接复制会报IndentationError,这在实测中是非常扣分的体验。说明Kimi在代码生成类任务中的输出质量控制不够严谨,虽有正确思路,但交付物需要人工二次修正。
三、交互体验:豆包最顺滑,但顺滑得让人怀疑
豆包的交互是三家里最接近”成熟消费级产品”的:语音输入、拍照提问、快捷指令,学生上手零门槛。但这种顺滑有代价——它倾向于给你”最讨喜的回答”而不是”最准确的回答”。
DeepSeek的界面朴素得像上个时代的产品,功能入口少,但它把”深度思考”按钮做得很显眼——这是一种产品设计上的自信:你来看重的就是推理能力本身。
Kimi的问题在于交互没有跟上它的长板。长文本处理是它的王牌,但围绕这张王牌的操作路径设计得很粗糙——上传、解析、追问的每一步都有摩擦感。
四、商业化的真相:3.8亿月活,换不来一天一百万
这是整场竞争里最荒诞的部分。
豆包3.82亿月活,上半年单日营收不到百万人民币。摊到每个用户头上,一天不到0.003元——还不够一次推理的算力成本。所以2026年5月,豆包上线了三档付费订阅,最高5088元/年,终于向”商业化闭环”迈出一步。
DeepSeek走了完全相反的路:C端App免费到底,赚开发者的钱。V4 API按token计费,年化营收做到4-5亿美元。8月16日还完成了涨价——它的底气是:重度用户(程序员、企业)对token价格的敏感度,远低于对模型质量的敏感度。
Kimi最尴尬:月活729万撑不起API生意,C端订阅又没有豆包的用户基数去摊薄成本。它被夹在中间——产品有口碑,商业没杠杆。

五、学生到底该用哪个?我的结论可能让你不爽
测了一个月,我的答案是:别忠诚于任何一个,按场景切换。
- 查资料、理解概念、debug代码 → DeepSeek(推理质量最高,免费)
- 论文长文本、文献综述 → Kimi(长文本仍是独门优势,别管月活)
- 日常琐事、口语化提问、语音输入 → 豆包(交互体验最好)
但这个”理性结论”恰恰暴露了行业的问题:没有一家愿意为“学生”这个场景做深。 豆包爱学虽然冲到了月活1944万(榜单第六),但那是剥离出来的一款独立App——主App里没有任何学生专属设计。Kimi有最好的长文本能力,却没有围绕”读论文”做工作流。DeepSeek推理最强,但连个像样的笔记导出都没有。
三家都在抢”全民入口”,没人肯俯身做”学生的那个AI”。
豆包赢了流量,DeepSeek赢了营收,Kimi赢了口碑——但如果你问我谁会笑到最后,我的判断是:下一个赢家的形态,现在还不存在。
一个真正围绕学习场景设计工作流的AI产品——读文献、整理笔记、生成提纲、管理知识——三家都只做了零碎一角。
本文由 @柚子 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




