首页
培训课程
名师辅导课
AI产品经理转岗特训营
BAT大厂产品运营体系课
B端C端全栈产品经理私教课
查看更多
个人自学课
互联网运营能力进阶
业务产品经理能力进阶
电商产品经理从入门到进阶
查看更多
企业内训课
数字化产品经理课
商业化产品实战课
数字化营销体系课
B端运营实战课
私域流量实战课
数据分析体系课
查看更多
分类浏览
业界动态
31053篇文章
产品设计
19452篇文章
产品运营
15283篇文章
产品经理
9589篇文章
职场攻略
5407篇文章
营销推广
4917篇文章
交互体验
3944篇文章
分析评测
3608篇文章
创业学院
2262篇文章
用户研究
1907篇文章
数据分析
1807篇文章
原型设计
1436篇文章
活动讲座
问答
企业培训
AI社区
摸鱼
HarmonyOS
搜索
APP
起点课堂会员权益
职业体系课特权
线下行业大会特权
个人IP打造特权
30+门专项技能课
1300+专题课程
12场职场软技能直播
12场求职辅导直播
12场专业技能直播
会员专属社群
荣耀标识
{{ userInfo.member ? '查看权益' : '开通会员' }}
发布
注册 | 登录
登录人人都是产品经理即可获得以下权益
关注优质作者
收藏优质内容
查阅浏览足迹
免费发布作品
参与提问答疑
交流互动学习
立即登录
首次使用?
点我注册
四小时发言实录刷屏背后,梁文锋的克制
唐辰同学
2026-07-23
1 评论
367 浏览
1 收藏
11 分钟
文|唐辰 图源:网络资料
DeepSeek蹚出通往AGI的第二条路。
今天,梁文锋在近期与投资者交流的会议记录刷屏。一个可能的背景是,DeepSeek近日完成成立以来的首轮外部融资,总额超500亿元人民币(约合74亿美元),投前估值约3675亿元(约543亿美元)。
在此之前,梁文锋对外坚持“不融资、不上市、不商业化”的三不原则。
这段长达4个小时谈话实录,梁文锋详细阐述了DeepSeek的组织文化、开源逻辑、技术路线图以及对行业竞争格局的看法。需要注意的是,该会议实录还没有得到其本人确认。
“克制是一种战略”
我在流传出的多个版本中,都注意到一个高频关键词:克制。
梁文锋花了很大篇幅对投资者强调,克制是一种战略。舍弃短期利益,砍掉非主线业务,不是为了显得清高,而是为了换取实现AGI的最大概率。
其中一个实录版本提到,他说了非常多次的“不”:不是天才,不赚不合理的利润、不追求用户量、不闭源、不做3D / 视频生成 / 世界模型,不做下一个超级App 。
不少观点将梁文锋的“克制”,解读为资源不足时的无奈取舍。
因为这在追求效率,着眼商业化以兑现资本承诺时,几乎把资本的故事都抽离掉,重点落在为了AGI的“克制”,很反常识。
这固然是基于现实作出的判断,但恰是这种非主流的姿态,成为市场重估DeepSeek价值的新标尺。
若再把梁文锋的路线,放在全球AI竞争的坐标系里看,我更愿意把这种“克制”理解为:
在算力约束下,他为换取AGI最大概率而进行的精密计算。
他在谈及中美差距时断言,“我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。”
目前,硅谷AI的范式是“资源溢出驱动涌现”。即堆最多的卡,训最大的模型,做最全的AI能力,相信规模到了智能自然会涌现。
这套逻辑在过去三年被验证有效,但模型能力越强、上下文越长、用户调用越频繁,对推理算力的消耗也越高,算力成本也越来越贵。
最新消息显示,OpenAI预计到2030年将在计算资源上投入约7500亿美元,高于2026年早些时候提出的6000亿美元规划。
同时,无边界扩张导致研发资源分散,商业化动作变形,组织熵增加剧。以Meta为例,其在开源Llama系列赢得声誉的同时,内部却因同时推进文本、多模态、元宇宙及机器人等多条战线,导致核心大模型团队的顶尖人才频繁流失,产品迭代节奏多次被打乱。
Google则在搜索、云业务与AI实验室的多重目标拉扯下,一度陷入“创新者窘境”,明明手握最强技术储备,却在生成式AI的产品化落地中屡屡迟疑,错失了先发身位。
这些巨头的困境,多来自技术以外的“战略贪婪”。
当一家公司同时押注多条AI路径,“什么都想做”的全能叙事,稀释了攻克AGI核心瓶颈所需的专注度。
按照梁文锋的表述,DeepSeek的路线很“克制”:当算力成为硬约束时,“做什么”远比“不做什么”更重要。极致聚焦主线任务,用工程能力弥补硬件代差,追求单位算力的产出效率而非绝对规模。
这在技术路线未收敛前,少即是多。
只有砍掉那些“看起来很美但偏离核心目标”的旁支业务,才能将有限的算力和人才集中在CoT(思维链)、Agent、持续学习等真正决定AGI成败的关键瓶颈上。
比如,DeepSeek-V3的训练成本远低于GPT-4o,性能却逼近第一梯队。
MiniMax和其创始人闫俊杰看到这里,不知会作何感想。
他们一开始就将有限的资金、人员等资源押注在文本、视频、语音、音乐四大模态上。如今,MiniMax的颓势,让不少人为其捏一把汗。
通往AGI的第二条路
DeepSeek的路线,正在被Kimi K3验证。
作为月之暗面首款3万亿参数级MoE模型,K3总参数规模达到2.8万亿。按照常规理解,这个规模的模型,每输出一次,算力都是指数级消耗。
但在其独特核心架构的支持下,达到华为在芯片领域提出的“韬定律”效果。
这个架构也被视为是一架超级引擎
,
通过落地KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度MoE三项关键技术,完成了一次对“模型生产效率”的重构。
根据月之暗面此前发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用最高削减75%,100万上下文长度下的解码吞吐量提升至原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提升约25%,额外成本不到2%。
这意味着同样一笔算力预算,过去只能跑1个任务,K3能跑4个,且质量不打折。
SemiAnalysis的报告指出,KDA将推理速度提升300%,同时在长上下文处理上保持接近Transformer的性能。开发者社区的实测也反馈,在长流程Agent任务和代码生成方面,K3已具备与国际头部模型竞争的实力。
从根本上看,
K3依然遵循Scaling Law,但它把刀挥向了粗糙的算法浪费。当硅谷AI企业还在不断囤卡时,Kimi通过重构算法链路、精简计算冗余,走出了一条“每瓦特智能产出比”最大化的路径。
也可以说,K3所采用的KDA混合线性注意力机制,正是AI领域的“韬定律”实践。硅谷主流的Transformer路线是“大力出奇迹”的燃油车,KDA更像是追求“热效率极致”的混动引擎。
与此同时,企业用户和开发者也开始用脚投票。一部分开发者已经用上“模型路由”服务,根据不同任务自动选择成本最低、效率最高的AI模型,这其中当然包括Kimi在内的中国模型。
这个范式让华尔街观察人士和投资者感到意外,他们像惊诧DeepSeek一样,再度质疑硅谷数千亿美元投资AI是否能得到相应回报、美国AI领先优势是否被削弱。
2025年1月,DeepSeek的横空出世,冲击了硅谷AI的算力叙事。它表明,中国AI要追上世界领先模型的水平,未必需要投入同等量级的芯片与资金。
随着梁文锋版AGI路线图的明确、Kimi K3的落地,中国AI的效率范式轮廓也愈发清晰。
更重要的是,它已经在影响中国AI产业链的上下游。比如算力供给侧,它倒逼国产芯片厂商不再盲目对标英伟达的峰值算力,转而优化编译器、互联带宽与系统级能效。
应用落地侧,它让大量原本被高昂推理成本挡在门外的中小企业、垂直行业开发者得以入场,医疗、教育、工业质检等场景的AI渗透率因此加速提升。
可以说,DeepSeek、Kimi所代表的路线正在催生效率革命,也在重塑整个中国AI产业的成本结构与价值分配方式。它让外界相信:通向 AGI 的道路,不必都挤在硅谷AI的赛道上。
但我们也需要认识到,克制是一种战略,也就要有边界。
比如,基础科学研究、超大规模基础预训练等环节,依旧需要持续重金投入,不能盲目套用取舍逻辑。更不能神化DeepSeek、Kimi 的发展路径,将克制教条化。
在我看来,梁文锋这场长达四小时的交流,除了向投资者宣讲商业蓝图,也向AI行业提出了一个重要的问题:
奔赴AGI,我们能不能允许自己慢一点,少追逐一些边缘诱惑?
这在普遍存在FOMO(错失恐惧症)情绪的当下,Sora火了做视频、具身智能热了造机器,聚焦一下,也可能是另外一种“快”。
参考资料:
腾讯科技,《4小时、118个回答,梁文锋内部交流回应一切》
唐辰同学,《Kimi“熔断”,杨植麟“摸高”》
本文由作者【唐辰同学】,微信公众号:【唐辰同学】,原创/授权 发布于平台,未经许可,禁止转载。
收藏
已收藏
{{ postmeta.bookmark }}
点赞
已赞
{{ postmeta.postlike }}
更多精彩内容,请关注人人都是产品经理微信公众号或下载App
DeepSeek
唐辰同学
科技自媒体,关注互联网科技及商业故事
102篇作品
240558总阅读量
为你推荐
从市场维度告诉你:创业该卖什么?
02-20
7500 浏览
基于国产密码的分布式架构:公共服务的安全与优化新策略
05-23
3351 浏览
大卖场转型:电商化救命,会员店换轨
05-26
2460 浏览
ChatGPT,正在动摇谷歌的商业长城
01-03
3795 浏览
私域业务怎么和ChatGPT结合
03-24
8981 浏览
评论
评论请登录
哆啦A梦不懂AI
认可克制的战略价值,但把克制完全归因于算力约束可能低估了选择的主观性。如果算力无限,梁文锋还会坚持不碰视频、多模态吗?路线选择里总有价值观成分,不只是精算。
2小时前
来自广东
回复
为你推荐
接到“女儿”求救电话,亲妈差点被AI仿声骗了
04-28
4398 浏览
融合低代码与GPT,微软的又一个神奇颠覆?
03-23
5751 浏览
原型说明咋写-普通上传文件
12-08
5211 浏览
认可克制的战略价值,但把克制完全归因于算力约束可能低估了选择的主观性。如果算力无限,梁文锋还会坚持不碰视频、多模态吗?路线选择里总有价值观成分,不只是精算。