梁文峰看到的大模型下一个瓶颈,已经有团队在解决了

0 评论 312 浏览 0 收藏 10 分钟

大模型API普遍面临“一次性交易”困境,Mind Lab发布的Macaron V1通过LoRA强化学习与Mixture of LoRA架构,让模型在使用中持续学习,两周即实现千万级年化营收,或将成为打破静态模型瓶颈的关键突破。

最近,梁文锋在一场投资者交流会上,把大模型下一步该往哪走讲得非常直白。

Agent 之后,下一个瓶颈是持续学习。原话是——”我们现在站在 Agent 这个地方,能看到的是下一个瓶颈,就是持续学习。这个是看得到的,是相对来讲比较明确的。”

「AI 现在不缺品位和直觉,它缺的是持续学习的能力。」

很巧,它几乎精确地描述了一家公司的技术赌注——Mind Lab。他们刚刚发布的 Macaron V1,核心架构就是围绕”让模型在使用过程中持续学习”设计的。

最近我看了 Mind Lab 发布 Macaron V1 的资料,越看越觉得,这家团队在这个路线上已经探索来一段时间了。这篇文章我想顺着这条主线,聊聊他们到底赌对了什么,又是怎么把一个听起来很理想化的想法,一步步做成了一个能收钱的产品。

静态模型这道墙,大家都绕着走

先说说这个死穴到底有多普遍。今天市面上大多数模型 API,本质上做的都是一次性交易,你发一个请求过去,它吐出一个结果,仅此而已。不管你们之间已经打过多少次交道,模型都不会因为这些交互变得更懂你,下一次调用它的时候,一切又是从零开始。

这个问题在个人场景里可能只是有点烦,放到企业场景里就变成了真金白银的损失。一个做科研的团队,一个流程复杂的工业企业,他们手里的数据往往极其专业,通用模型很难天然理解这些任务。可这些企业又不太愿意把核心数据交出去,让基座模型公司拿去重新训练一遍,风险和成本都太高。这中间的缺口,一直没有人真正填上。

Mind Lab 的赌注,让模型自己学会成长

Mind Lab 押的赌注很直接,模型不该是训练完就定型的静态工具,而应该在被使用的过程中持续学习,越用越懂你。能撑起这件事的技术路线,叫 LoRA 强化学习,简单说就是用很低的成本,做到和全参数微调差不多的效果,不用每次都把整个模型推倒重训。

这条路不是 Mind Lab 一个人在赌。OpenAI 联合创始人、PPO 算法的作者 John Schulman,现在是 Thinking Machines Lab 的首席科学家,他写过一篇很有名的文章,说在大多数后训练场景下,LoRA 的样本效率和最终效果,和全量微调几乎没有差别,这跟大家印象里 LoRA 是打折方案完全相反。他把这种情况叫低遗憾区间,说它覆盖了绝大多数实际的后训练任务。做模型托管的平台也在往这个方向靠拢,Fireworks AI 估值 175 亿美元,能在一个基座模型上同时挂几百个 LoRA,根据每次请求动态选用;Together AI 刚完成 8 亿美元的 C 轮,已经把 LoRA 设成了默认的微调方式。全球最前沿的团队和最大的托管平台都在往这个方向靠,这条路至少不是一厢情愿。

从想法到 Macaron V1,怎么落地的

想法靠谱是一回事,做出来是另一回事。Macaron V1 用的架构叫 Mixture of LoRA,简称 MoL,基座是 GLM-5.2,原生支持 200 万 token 的超长上下文。旗舰版 Venti 是 744B 的基座加四个 10 亿参数的 LoRA 专家,分别管对话、工具调用、写代码和界面生成。这个拆分背后的逻辑很朴素,聊天、写代码这些能力背后的思维方式差别很大,硬塞进同一组参数里训练会互相打架,这边进步了那边就退步。拆成独立的 LoRA 以后,以后要加新能力,直接训一个新的插进去就行,完全不用动已经练好的部分。这其实就是持续学习在架构层面最直接的样子。

能把这套东西做扎实,靠的是团队从成立以来一步步攒下的家底。2025 年 12 月,他们用十分之一的算力就完成了万亿参数模型的强化学习后训练,这个能力当时全球只有两家团队做到,另一家是 Thinking Machines Lab。今年 7 月又放出 LongStraw,在固定算力下把强化学习训练的上下文推到了 200 万 token,解决了推理能读百万级 token、但训练卡在二十多万 token 这道墙的老问题。再加上底层的 MinT 平台,执行器和学习器之间只传 LoRA 适配器,不用搬整个模型权重,才撑得住百万级的适配器目录。这些看起来分散的研究成果,其实都是在为同一件事做铺垫。

还有一个容易被忽略的助攻,是中国的开源模型生态。Macaron-V1-Preview 基于 GLM-5.1,这次的 Venti 用了最新的 GLM-5.2,轻量版 Tall 基于通义千问 3.6。海外一些团队因为各种原因坚持自己从头做开源底座,结果精力被大量牵扯,模型能力反而上不去。中国的开源模型这一两年已经能摸到全球最前沿的水平,站在这个起点上做 LoRA 强化学习,相当于省下了从零造轮子的时间,把力气都花在了持续学习这件事本身上。

市场已经在验证这个赌注

技术故事讲得再漂亮,最后还是要回到有没有人愿意付钱。今年 6 月底模型发布,7 月开始商业化,Mind Lab 用了两周时间就摸到了千万美元级的年化营收,是目前模型 API 收入增速最快的公司之一。我不太想把这个数字本身当成重点,真正让我在意的是这件事发生的速度,两周,说明这条持续学习的路线,商业上是真的走得通的,不是一个只能停留在论文里的概念。

更关键的是他们想改的不只是模型能力,还有卖模型这件事本身的逻辑。客户买的不再只是 Token,还包括模型在他们自己场景里持续学习和迭代的过程,这恰好是文章开头那个死穴的解法,一次性交易变成了持续变强的关系。目前他们已经和一家头部手机厂商、耳机公司韶音、AI 硬件初创公司 Odyss 建立了合作,团队内部有句话我印象很深,他们希望训练模型这件事,最后能变得和调用模型一样简单,会用 Token,就能训 Token。

写在最后

写到这里,我想起强化学习之父 Richard Sutton 那篇很有名的文章,叫经验时代。他说下一阶段 AI 的能力提升,不会主要来自继续吸收人类已经产生的数据,而是来自 Agent 在真实环境里长期的行动、反馈和持续学习。这几乎就是 Mind Lab 整个技术路线的注脚。有意思的是,Sutton 本人最近也传出创业消息,他的新公司叫 Oak Lab,追求的同样是低成本、高效率的持续学习模型。

一个快七十岁的理论奠基人选择在这个时间点下场创业,这件事本身就很说明问题。静态模型这道墙,可能真的要被推倒了,而 Mind Lab 现在做的,是在这条路上先跑出了一段看得见的距离。

本文由人人都是产品经理作者【深思圈】,微信公众号:【深思圈】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!