Kimi K3深度分析报告,月之暗面如何用最笨的路线重回牌桌
月之暗面发布Kimi K3,2.8万亿参数刷新开源模型纪录,登顶代码榜。这家被行业判了缓刑的公司,用规模路线重回牌桌。本文拆解其技术、融资与定位,探讨开源模型的新活法。

AI过去一年在卷什么?卷推理、卷Agent、卷成本、卷上下文窗口,什么都在卷,唯独没有再碰最笨、最烧钱、最能证明硬实力的方向,把模型本身做得更大。
7月16日,月之暗面发布Kimi K3,总参数2.8万亿,混合专家架构,896个专家里每次激活16个,原生视觉理解,100万token上下文。这是目前全球参数量最大的开源模型,官方管它叫首个开源3T级模型,2.8万亿四舍五入算3万亿,这个数学我认了。
发布之后几个小时,K3登顶了大模型竞技场Arena的代码榜,中国模型第一次拿下这个榜单。
一个18个月前还被行业判了缓刑的公司,用一次发布把自己重新抬回了牌桌中央。这背后的路线选择,我觉得值得认真拆一拆。
从被碾过到重回牌桌
那18个月有多难熬
理解K3,得先理解月之暗面这18个月过得有多憋屈。
DeepSeek横空出世那阵子,整个行业的叙事被改写了,便宜、开源、够用,成了新的政治正确,月之暗面原本靠长文本建立起来的心智,一夜之间不值钱了,市场地位肉眼可见地往下滑。海外媒体在复盘K3的时候用了一个很扎心的说法,说这是一家市场位置被侵蚀了18个月的公司的回归之战。
我当时身边不少朋友都觉得这家公司悬了,融资那么贵,路线那么重,拿什么跟便宜大碗的对手打。
那段时间行业里流行一种论调,说预训练的规模红利吃完了,接下来拼的是推理优化和工程能力,把模型做大是上一个时代的思维。这种论调越是主流,坚持规模路线的公司日子就越难过,融资故事不好讲,招人不好招,连发布会都不好开,你说你参数大,人家问你比DeepSeek便宜吗?
K3是一条被忽视的暗线
很多人以为K3是憋大招憋出来的孤注一掷,翻一下时间线你会发现根本不是这么回事。
过去12个月里,有9个月的时间,开源模型的参数规模上限都是Kimi系列在保持。K2、K2.5一路铺过来,规模路线从来没断过,只是没人当回事。大家的注意力全在便宜和快上面,谁会关心一个慢慢把模型做大的公司呢?
这就是暗线的意思,所有人都看得见,所有人都没看。
发布前后的节奏,每一步都是算过的
再看发布节奏,你会发现月之暗面这次的操盘水平相当在线。
发布之前,一个代号Kivine的匿名模型出现在Arena榜单上,前端生成和3D任务的表现引发密集讨论,开发者社区猜了好几天这是谁家的。Kimi开放平台上一个关于K3限时充值活动的页面被短暂泄露,几个小时就撤了,可截图已经传遍了。热度在正式发布前就拉满了。
发布时机也卡得很准。往前几天,Fable 5和GPT-5.6 Sol刚刚全量上线,全球的注意力都在新一代旗舰上。往后一周多,世界人工智能大会就要在上海开幕。K3选在这个缝里发布,蹭到了对比的流量,又留足了线下展台的发酵时间。大会现场他们展台被围得水泄不通,有个俄罗斯观众对着镜头说搞AI的都该来看看。
你说这些是巧合我是不信的。
开源赛道的两种活法
发布当天谁在跌
K3发布当天有个细节很多人没注意,Z.ai和MiniMax的股价在港股市场明显下挫。
这个信号比任何评测都诚实,投资人用钱投票告诉你,开源模型的竞争格局被这一次发布改写了,原来的位次要重新排。
目前这个赛道的头部选手,DeepSeek的V4 Pro参数1.6万亿,通义、智谱、MiniMax各守一摊。K3用2.8万亿直接把规模天花板抬高了将近一倍,其他家要么跟,要么就得承认自己走的是另一条路。
这里补一个容易被忽略的背景。中国的开源模型这两年在西方公司里的采用率一直在悄悄往上爬,能力追上来了,价格只有美国旗舰的零头,务实的工程团队会用脚投票。美国的立法者已经在讨论怎么限制本土公司采用中国模型,一个议题能被摆上桌面认真讨论,本身就说明渗透程度到了让人坐不住的地步。
本质是两种生存逻辑
我把开源模型的活法归成两种:
一种叫跟随复现型。闭源旗舰先把能力探出来,开源模型跟在后面,用更低的价格把八成的能力复现出来。过去一年多,几乎所有开源玩家走的都是这条路。这条路的生存逻辑是性价比,你便宜,你就有人用。
一种叫边界定义型。不等闭源探路,自己主动往下一代能力的无人区里冲,规模、上下文、长程任务,直接参与定义标准。K3是第一个认真走这条路的开源模型。
区别在哪呢,跟随复现型的天花板永远是别人定的,你做得再好,也是平替,边界定义型赌的是话语权,赌赢了,标准就是你定的。
增长故事背后的一个隐患
夸完了说点扎心的,这2.8万亿参数的模型,官方推荐的部署配置是至少64张加速卡组成的超节点,这是什么概念,绝大多数企业别说部署了,连评估的资格都没有,权重开源对它们来说只是一个名义上的可用,真要用还是得走API。
这就带出一个很微妙的问题。开源的意义到底是什么,以前我们说开源等于人人可用,K3之后这个等式要改写成人人可看、少数可用。这个变化是好是坏,我到现在也没想明白,只能说它真实地发生了…
为什么敢走最笨的路
弹药是这么攒出来的
走规模路线的前提是有钱,而且是持续有钱。
看一下月之暗面的融资曲线,去年年底C轮5亿美元,投后估值43亿。今年5月拿了差不多20亿美元,估值冲破200亿。6月底新一轮启动的时候,投前估值已经报到315亿了。半年多时间估值翻了七倍还多,老股东超额认购,这个曲线在如今的一级市场里算是异类。
融资之外还有自己的造血能力,今年4月披露的数据,Kimi的年化经常性收入已经超过2亿美元,主要来自订阅收入,一级市场愿意给钱,自己又能挣钱,两条腿一起撑,规模路线的持续投入才有底。
钱给了它试错的底气,规模路线最怕的就是烧到一半没粮了,前功尽弃。
全行业不敢碰的方向恰恰是机会
我一直有个观察,当一个行业所有人都在同一个方向上卷的时候,被放弃的那个方向往往藏着最大的机会。
把模型做大这件事,前两年被讲成了过时的故事,算力被卡、成本失控、收益递减,每一条都像是劝退的理由。K3发布之后,美国银行的分析师在报告里写了一个判断,大意是说尽管算力条件受限,K3证明了预训练规模化配上架构创新,依然能给旗舰模型带来跨越式的能力提升。
翻译成人话,Scaling没死,只是没人敢赌了。
架构创新才是让这条路走通的关键
光堆参数是走不通的,2.8万亿参数如果按老架构去推理,成本会离谱到没有商业意义。
K3的解法藏在三个技术组件里,KDA混合线性注意力,注意力残差,加上高稀疏度的专家路由设计,896个专家每次只激活16个,官方给的数字是,从算力到模型能力的整体转化效率比上一代提升了两倍半左右,这三个组件此前都以研究形式开源过,不是这次凭空掏出来的。
我不是搞算法的,具体的技术细节等7月27日技术报告出来再说,可有一点是确定的,规模路线能不能走通,比的不是谁参数多,比的是谁能让大参数在经济上成立。
它到底想当什么
官方口径里藏着的定位信号
看一家公司的产品定位,别听它说了什么,要看它没说什么。
K3的官方介绍里,关键词是长程编程、知识工作、深度研究、多模态理解,通篇看下来,它没有一个字在讲聊天,没有一个字在讲陪伴,这个模型从定位上就没打算做你的日常助手,它想当的是一个可以数小时无人值守干活的数字员工。
官方给的能力描述也很直白,说K3能在极少人工干预的情况下持续执行数小时的工程任务,能理解庞大的历史代码库,能自己在终端跑命令、调工具,跑出错了还能自己看日志、自己纠偏。
秀肌肉的信号很明确
发布物料里有两个案例,我认为是理解K3定位的钥匙。
一个是K3自己剪的官方宣传片,从56段原始素材里完成选片、卡点、动作匹配和音频处理,用自家模型剪自家发布会的片子,这个行为本身就是产品定位的宣言。
一个是K3做了一份覆盖ASIC行业42年历史的深度研究报告,过程里跑了120多轮递归式的自我改进,执行了2800多次网页搜索和抓取,处理了87份季报和99份原始PDF,合计超过一万一千页资料,最后产出的是带定制图表和交互叙事的完整报告。
同一批物料里还有一份可控核聚变的产业研究,时间线、树状图、瀑布图、甘特图一应俱全,成品直接是能拿去给客户汇报的咨询报告规格。
这几个案例指向同一个方向,K3卖的不是聊天,是长程任务的完成度,顺带说一个很实际的细节,K3的API兼容OpenAI的SDK,开发者迁移过来几乎没有改造成本,这说明它对承接存量开发者这件事是有备而来的。
自报成绩单里的诚实与鸡贼
官方公布的基准测试结果,K3大部分项目超过了Opus 4.8和GPT-5.5,输给Fable 5和GPT-5.6 Sol。
这份成绩单我愿意给它一个评价,诚实的鸡贼,诚实在于它没吹自己天下第一,明明白白承认打不过最新的两个闭源旗舰,鸡贼在于这个卡位太精准了,开源第一、全球第三,既有话题性又留了余地,媒体爱传,同行难受,用户还觉得它实在。
上手实测与能力边界
编程能力,逻辑在线,审美偏科
社区里有个流传很广的测试,让K3从零做一个宠物寄养管理系统,它开工之前先把需求里所有互相矛盾的地方完整列了出来,每一组矛盾都给了推荐的处理方案,这个表现放在真实的开发协作场景里是相当能打的。
代码质量没得挑,界面就有点一言难尽了,默认生成的界面像一个开发者后台,功能全都在,就是不像给普通用户用的东西。要补一句用户端界面的要求,它才会把预约、付款、宠物实时状态这些流程做成正常产品的样子。
我的判断是,K3的逻辑分析能力过关,能发现需求里的结构性冲突,可它对普通用户审美和交互预期的直觉是偏弱的,跟它优化长程高难任务的训练定位是吻合的,擅长处理逻辑,不擅长猜人心。
代码调试
一段文件同步引擎的Node.js代码,埋的坑是分布式系统里的经典难题,多台设备同时编辑同一个文件,同步时拿时间戳当唯一的冲突裁决依据,后果就是旧版本可能反过来覆盖新版本。
这种bug阴险在哪呢,代码没有语法错误,逻辑看上去也通,只有真正理解分布式一致性的人才知道坑埋在哪,K3把问题的根源准确指了出来,修复方案也给到位了,社区实测的普遍反馈是,K3的从零生成和调试能力都在第一梯队,短板不在能不能做对,在做对要花多久。
公认的最强项的是视觉与3D
前端生成的审美水准,多个独立评测都认为已经摸到Fable 5的边了,3D场景更是被反复拿出来吹。
同一套提示词让K3和GPT-5.6 Sol各做一个瀑布场景,Sol把彩虹给漏了,K3不光有彩虹,水汽氤氲的质感也处理得更接近真实,差距就体现在这种地方,一个在完成需求,一个在琢磨效果。
长文本与知识工作
100万token的上下文窗口,配合长程任务能力,官方想讲的故事是知识工作的端到端交付,它有一套叫Kimi Work的工作流形态,前面提到的行业研究报告就是在这个形态下跑出来的。
官方口径说,K3在内部面向真实生产场景的评测里表现出一致的提升,这些评测来自真实用户和智能体协作流程中反复出现的任务模式,这段话我提醒一句,属于厂商自我陈述,方向可以参考,力度自己打折。多家独立评测倒是给了侧面印证,长文档的理解和结构化输出确实稳,几万字的材料喂进去,拆出来的框架很少跑偏,这一点对做研究和写报告的人是实打实的生产力。
速度和成本
现阶段K3只开放了max一个推理档位,默认深度思考拉满,有个海外开发者做了个很形象的测试,让K3画一只骑自行车的鹈鹕,模型消耗了一万三千多个推理token,最后输出三千四百个token的结果,这一只鹈鹕的成本是25美分。
社区实测的普遍结论是,同样的任务,K3要花掉别家两到三倍的时间,官方说后续会开放低档和高档的推理强度,速度问题可能会缓解,眼下这就是它最疼的地方。
产品经理看了会沉默的分层定价设计
K3的100万上下文不是人人都能用的,最低档49元的会员根本调不了K3,99元档只给256K,199元档往上才解锁完整的100万,把模型的核心卖点按会员等级切着卖,这个设计在商业上我理解,在体验上我保留意见。
它制造了一种很拧巴的用户心理,你宣传的时候讲100万上下文讲得震天响,用户充了钱进来发现自己那一档摸不到,这种落差感对品牌信任的伤害,可能比多收的那点钱值钱得多。
我做产品这些年有个体会,定价可以贵,规则不能藏。用户对贵的容忍度远比对被套路的容忍度高,这个分层设计要是把话在充值之前说透,骂声至少能少一半。
一个结构性判断
社区对K3还有两个高频吐槽,不约束配色和动效的话它会忍不住往里加东西,UI风格做多了会有似曾相识的感觉。
我的看法是本质上是同一件事,模型能力溢出了,产品化没跟上,它有太多能力想展示,没有一个足够好的产品层去约束和分配这些能力,这不是模型的失败,这是产品的缺位,而缺位的地方就是机会。
开源旗舰的定价权
为什么这件事值得单独拎出来讲
前面铺了这么多,这一节是全文的论点制高点。K3真正改变的不是某项能力的排名,是开源模型的定价逻辑
过去开源等于便宜,这是刻在所有人认知里的等式。K3把这个等式打破了
一份既便宜又昂贵的价目表
缓存命中的输入每百万token三毛美金,未命中三美金,输出十五美金。对比一下,Fable 5的输出价格是五十美金每百万token。
跟闭源旗舰比,K3便宜了三倍多,性价比依然成立。跟开源模型的历史价格比,这是天价,以前的开源模型哪敢这么开价。
还有一个不太起眼的参数值得一提,K3默认的最大生成长度是13万token出头,最高可以拉到100万级别,生成长度的上限直接决定了它能一口气交付多大的东西,一份完整的行业报告、一个中等规模的前端项目,理论上都能单次产出,这个能力和它的定价是配套的。
敢这么定价,背后是它认为自己提供的不是平替价值,是旗舰价值。虎嗅上有篇文章说了句挺狠的话,大意是普通人可能快用不起最强开源模型了,对开源模型的评判标准会更多转向产业和真实生产力价值。我认同这个观察,这可能是K3给整个行业带来的最深远的一个改变。
别家为什么跟不了
定价权不是想要就有的,背后得有壁垒撑着,K3的壁垒是双重的。第一重是2.8万亿参数的训练成本,能掏得起这张门票的开源玩家一只手数得过来。第二重是KDA这些组件是长期研究攒出来的,临时抱佛脚复现不了,两重壁垒叠在一起,短期内这个身位很难被追平。
一个绕不开的争议
K3发布后,海外开发者社区里有一条质疑的暗流,有人在K3的思考过程里发现了疑似引用Anthropic安全政策的痕迹,据此猜测它的训练环节用了Claude的输出做蒸馏,Hacker News和Reddit上为这事吵了好几轮,有人翻出更早的学术研究,说Kimi系列模型的行为指纹在工具调用模式上更接近Claude而不是GPT。
平心而论,行为指纹这种证据的证明力是有限的,风格像不等于数据来自,模型之间互相学习痕迹的溯源,学术界自己都还没有公认的可靠方法。
质疑是真实存在的,证据是间接的,结论是没有的。所有严肃一点的评测文章都在强调,这是一个开放问题,不是一个已经坐实的事实。7月27日权重放出来之后,社区会有机会做更深入的检验。
压力测试
K3发布对市场是一次真刀真枪的压力测试。
半导体股票下跌,逻辑是如果中国的开源模型能用受限的算力做到这个水平,那砸进美国AI基建的天量资本开支,回报率是不是要打个问号,这个剧本和之前DeepSeek引发的那一轮恐慌几乎一模一样。
有位美国的行业分析师直接说这是一次过度反应,和上次的恐慌相似得让人吃惊,他把原因归到政治层面,说华盛顿正在辩论该不该用中国的开源模型,情绪被放大了。他还补了一句挺讽刺的话,说中国人用自己的模型看起来过得挺好。
两种解读你信哪个不重要,重要的是,一个中国开源模型的发布能引发这个量级的市场反应,还能把上一次的恐慌剧本几乎原样重演一遍,这件事本身就是答案。市场用真金白银承认了一个它嘴上不愿意承认的判断,中美模型之间的差距,已经小到能影响资产定价了。
中外舆论的温差
怎么看口碑才不会被带偏
看模型口碑有个坑,信源是分层的,混着看必被带偏。我把信源分成三层,官方基准是厂商的自我陈述,方向可参考,数字要打折,独立评测是第三方的交叉验证,可信度最高,覆盖面有限,社区情绪是放大器,能看出关注度,看不出真实水平。
三个词就能概括国内言论
强得意外,慢得着急,贵得敢要价。
强,指的是编程、3D、前端审美这些独立评测反复验证过的硬能力。慢,指的是max档动辄半小时的等待。贵,指的是会员分层和那份旗舰价目表。国内讨论基本都在这三个词的范围里打转,情绪的底色是又爱又恨。
海外的声音,三层反应一层比一层深
海外的反应有意思得多,市场层,前面讲过了,芯片股下跌,恐慌情绪蔓延。
意见领袖层像PyTorch的联合创始人公开说这是世界级的模型。一位前白宫AI政策顾问评价说,这是对整个行业有重大影响的时刻。Stability AI的创始人说了那句被转疯了的话,美国的实验室最终会去蒸馏中国的模型。
开发者反倒是最冷静的。那位做鹈鹕测试的知名博主认真算了推理成本的账。有人把14项直接对比的基准逐项拆开,Fable 5赢了8项,K3赢了6项,据此批评媒体只挑最抓眼球的那张图做标题。细看分项更有意思,图表和仪表盘理解这类任务,Fable 5依然明显领先,93.5比91.3。还有评测机构提醒了一个更根本的问题,K3目前所有的成绩都还没有同一测试框架下的独立复现,权重放出来之前,严格讲所有训练层面的声明都处在无法验证的状态。Hacker News上还有人抖机灵,说排在两个模型后面的第二名,按小学数学应该叫第三名。
温差本身就是最大的信号
把中外舆论放在一起看,那个开头的拧巴就解开了。
国内嫌贵,是因为用户在拿它跟过去的开源模型比,比完发现平替变贵了,海外恐慌,是因为市场在拿它跟闭源旗舰比,比完发现差距快没了,两边用的参照系不同,得出的情绪相反,指向的事实却是同一个。
没有人再把K3当平替看了,它被当成正主对待了,嫌贵和恐慌,是这个事实投在两个人群身上的不同影子。
这个视角一换,很多争论就没意义了,争K3到底值不值那个价,不如想清楚你拿它当什么用,当聊天工具,它又慢又贵,不值,当一个能连干几个小时的数字员工,账就要重新算了。
机会点与一个悬念
照例用机会点优先级收尾,按价值和难度排序,这是我作为PM最想说的部分:
第一的是推理档位分级,把承诺的低档和高档尽快放出来,让用户能在速度和质量之间自己做取舍,价值极高,难度不大,纯产品决策,早一天上线早一天止血。眼下所有负面口碑里,慢是唯一一个纯靠产品配置就能大幅缓解的
排第二的是能力感知化设计,2.8万亿参数的差异,普通用户在对话框里是感知不到的。怎么让用户看见模型在长程任务里干了什么,比如把那种上百轮的自我改进过程可视化出来,这是把技术优势翻译成产品体验的关键一役。
第三的是Agent场景的产品闭环。前面说了,炫技和模板化的病根是能力溢出而产品缺位,谁能把K3的长程能力包进一个约束得当的产品壳里,谁就吃到最大的一波红利,这事月之暗面自己不做,就会有别人抢着做。
排第四的是会员定价的信任修复,分层可以有,落差感不能有,哪怕只是把各档位能用什么、不能用什么在充值页面写得明明白白,都比现在这种充完钱才发现摸不到核心能力的体验强得多。
给同行的三点启发
写了这么长,落到我们这些从业者身上,我觉得有三件事值得记下来。
评估模型的方式要进行优化,对话框里问几个问题就下结论的时代过去了,K3这一代模型的差异体现在长程任务里,你得让它真干几个小时的活,才知道它的成色,做模型选型的同学,评测用例应该对应的升级了。
二是选型的成本逻辑有变化,开源等于省钱,K3的价目表和部署门槛摆在那里。以前的决策树是先看开源够不够用,不够再上闭源,以后可能要按任务价值分层,高价值长程任务用旗舰,不分开源闭源,日常任务用便宜的小模型。
三是出现了应用层的窗口期,能力溢出而产品缺位,它本身就是机会,模型已经能干的事和产品让用户顺手干成的事之间,隔着一整层产品化的空间,这层空间眼下几乎是空的。
7月27日,K3的完整权重按承诺应该放出来了。到那天,蒸馏的质疑会迎来第一次真正的检验,部署门槛的问题会有社区给出的答案,这份自报的成绩单也会被扒得底朝天,这篇报告里的所有判断,都可能被那一天的新信息修正。
本文由 @山姆 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




