黄仁勋力挺K3开源,但模型都一样了,AI产品的差异化从哪来?
黄仁勋首条推文联名76家公司,月之暗面开源2.8万亿参数模型,AI产品经理的焦虑被彻底点燃:模型都一样了,产品凭什么不一样?本文从开源之争的底层逻辑切入,拆解AI产品经理真正的差异化来源,不是选模型、调提示词或堆功能,而是定义什么叫做对的能力。

7 月 24 号,黄仁勋发了他人生中第一条推文。

开头第一句就是 For my first post。内容是一封联名信,标题叫《Open Weights and American AI Leadership》。这条推文现在有 6361 万次浏览。
三天后,月之暗面把 Kimi K3 全栈开源,2.8 万亿参数的模型权重、技术报告、三项底层 Infra 技术,全放出来了。

开源两天,9.9 万次下载,7840 个 like。模型卡上写着一句话:the world’s first open 3T-class model。
这是它官方模型卡上的评测表。GPQA Diamond 93.5 对 Claude Opus 4.8 的 91.0,FrontierSWE 81.2 对 66.7,SWE-Marathon 42.0 对 40.0。一个能下载下来的开源模型,在多项上已经越过了闭源前沿。

那两天我收到一条消息:
K3模型都开源了,能力还比肩Opus4.8,那 AI 产品经理到底做什么?
我大概知道他为什么问这个。他做了四年传统产品经理,B 端 SaaS,最近半年在自学AI,简历上刚加了一行「熟悉主流大模型与提示词优化」。然后他刷到 K3 开源的新闻,看到那些能力对比图,第一反应不是兴奋,是那行字白写了。
但我知道他真正想问的是:
如果模型对所有人都一样,我做的产品凭什么跟别人不一样?
这个问题我答不了一句话,所以写了这篇。
一、先把这条新闻讲对:黄仁勋在护什么
大部分转发这条新闻的号,讲的是「中美 AI 开源之争」。那个视角对你没什么用,而且很多人都在讲。

随手搜一下就是这样,硅谷分裂、内战打响、开源革命、全链受益。角度全一样,你读完十篇和读完一篇,能带走的东西一样多。
对AIPM来说真正有用的是:看懂各家为什么站这个队,因为同样的分析方法,你以后每次做技术选型都要用。
先看时间线。

这七个节点里,真正有因果关系的是第 2 个和第 6 个。为什么,后面会说。
签名名单我读了英伟达官网的 PDF 原件,76 家。英伟达、微软、Meta、Google、OpenAI、IBM、Hugging Face、Mistral、Palantir、Linux 基金会、Y Combinator 都在。

你可以在这张图上自己数一遍。Google 在,OpenAI 在,Meta、Microsoft、NVIDIA 都在。
唯一缺席的前沿模型厂商,是 Anthropic。
这个缺席本身就是答案。因为这轮制裁指控的核心,就是说月之暗面蒸馏了 Anthropic 的模型。而信里有一整段专门反驳这件事:

Distillation, or the practice of using one model’s outputs to help train or improve another, is a widely used technique for model improvement, evaluation, and validation.
蒸馏,也就是用一个模型的输出来训练或改进另一个模型,是一项被广泛使用的技术。
76 家公司联名,当着白宫的面把 Anthropic 的指控驳回去了。Anthropic 当然不会签。
那黄仁勋图什么?
表面理由信里写得很漂亮:开源让 AI 更安全、更有竞争、更容易被每个行业用上。这层是话术,但话术本身值得学,他把「支持开源」重新定义成了「美国国家利益」,而不是「帮中国」。
真实的目的?
英伟达真正的护城河不是芯片,是 CUDA。

CUDA 是什么?简单说,它是所有 AI 工程师写代码时用的那套工具和语言。这东西之于英伟达,相当于微信之于腾讯。腾讯真正的护城河从来不是那个 App 本身,是所有人的关系链都在里面,换不掉。
芯片是可以被替代的。华为昇腾在追,AMD 在追,Google 有自己的 TPU。但只要全世界的 AI 工程师还习惯用 CUDA 写代码,替代就永远慢一步。
现在回头看时间线里那条最不起眼的:2026 年 4 月,DeepSeek V4 全面迁移昇腾,底层从 CUDA 重写成了华为的 CANN。
这才是黄仁勋真正怕的东西。禁掉中国的开源模型,模型不会消失,它只会跑到别人的卡上,然后带着一大批开发者一起搬到非 CUDA 的生态里去。
这句话他其实写在信里了,藏在一堆政策建议中间:
avoiding premature restrictions on open models that stifle competition ordrive innovation overseas
避免对开源模型施加过早的限制,那会扼杀竞争,或者把创新赶到海外去。
drive innovation overseas。他怕的不是对手变强,是自己的生态被绕开。
说白了,他护的是 CUDA,不是芯片。
二、模型都一样了,差异化从哪来
上面那段国际新闻,对我们来说就一个:未来两年,你能拿到的模型,和你竞争对手能拿到的模型,会越来越接近同一批。
这不是坏消息,但它把一个问题推到了台前:模型一样,产品凭什么不一样?
这才是AI产品经理真正的价值
不是靠选对模型。
你能接 K3,对手也能接。你换 GPT-5,对手第二天也能换。API 文档是公开的,价格是公开的,榜单是公开的。选型这个动作本身,不产生任何差异。
不是靠提示词。
这条听起来还有点道理,实际上是最脆弱的。你今天调了三天的提示词,下一个模型版本可能原生就懂了。过去两年这种事发生过太多次:某个需要精心设计的思维链模板,新模型出来之后直接内置,你那三天白花。
提示词是一次性资产,模型一换就贬值。
不是靠功能。
AI 产品的功能抄起来比传统产品快得多。传统产品你抄一个功能要排期、要开发、要测试,可能三个月。AI 产品很多功能就是一段提示词加一个接口,看一眼就能复现。
也不是靠做得早。
先发优势在这个领域短得可怕。你先做半年,对手用一个更新的模型重做一遍,可能直接追平,因为他不用背你那半年积累的技术债。
甚至不是靠更懂 AI。
最反直觉,但它是这几条里最该早点想明白的。你花半年学的那些模型知识、微调技巧、Agent 框架,隔壁的算法工程师比你懂十倍,而且他还在以你追不上的速度往前跑。
你在这条赛道上永远追不上,也根本不需要追。
排到这里,好像什么都不剩了。
但有一个现象值得注意:同样接一个模型的两个团队,做出来的产品效果可以差出好几倍。
差在哪?
不是差在技术,是差在他们对「什么算做对了」的定义精度不一样。
三、假VS真 差异化
把上面的推导整理出来。

左边这一列的共同点:都是模型厂商下个版本可能原生自带的东西。
右边这一列的共同点:模型再强,也替你攒不出来。因为它们不是技术问题,是在一个具体业务里待久了才长出来的东西。
对一个正在转行的人来说,这张表看着有点绝望:右边四项里,场景数据、切换成本、人机分工,全都需要一家公司、一批用户、一段时间。你现在什么都没有。
但第三项不一样。
评测集是右边这一列里,唯一一个不需要公司、不需要用户、不需要预算、不需要工程团队,你今晚就能开始做的东西。
而且它恰恰证明了 AI 产品经理最核心的那个能力:定义什么叫做对。
后面两章讲这件事,一章讲它怎么用,一章讲它怎么建。
四、什么叫「知道什么叫做对」:从模型分层说起
先讲一个具体的动作,叫模型分层。
那封联名信里有一句话,我认为是全信对产品经理最有用的一句:
Open weights let every organization match the right model to the right job at the right cost, reserving frontier-scale capability for genuine frontier problems and running efficient, specialized models everywhere else.
开放权重让每个组织都能以合适的成本,把合适的模型匹配到合适的任务上:真正的前沿问题才用前沿模型,其他地方跑高效的专用模型。
翻成人话:不是所有任务都要用最强的模型。
开源之前这件事很难做,因为闭源厂商只给你它自己那条产品线。K3 这种量级的权重开放之后,模型分层从一个理论选项,变成了真能落地的成本工程。
分层长这样:

这张表的重点不在右边一列,在中间。
右边是结论,是可以抄的。「分类用小模型,推理用前沿模型」这种规则,你的竞争对手看一眼产品就能猜个八九不离十,挖走你一个人就全漏了,我之前就写过一篇专门讲怎么拆解产品。
中间那列抄不走。因为「90% 准确够用」这个判断,背后是你知道剩下 10% 由谁兜底、兜底的成本是多少、错一次的代价是什么。这些只有真的在这个业务里待过的人才说得出来。
再说一件很多人搞错的事:模型分层省下来的钱,重点不在省钱。
举例:某个场景每天要调用 5 万次。用前沿模型,每次 0.05 元,一天 2500 元,一年 90 多万。这个数字报上去,这个场景在预算表上会被直接划掉,它根本不会存在。
分层之后用小模型,每次 0.0005 元,一年 9000 块。它才第一次成立。
所以模型分层的真实产出,不是「我们省了 30% 的成本」,是「我们多做成了 3 个以前做不了的场景」。
这两句话在面试里说出来,是两个段位。前一句是执行者的口径,后一句是产品经理的口径。
五、评测集怎么建:
现在说最重要的一块。
上一章里那个「够用怎么定义」,写下来、能被执行、能被验证的形态,就是评测集。
为什么这是转行者唯一能自己造的东西
你没有公司,没有用户数据,没有工程团队,没有预算。这四样东西挡住了差异化清单里的其他三项。
但评测集不需要这四样中的任何一样。它需要的只有一件事:你对某个具体场景足够懂,能说清楚什么叫做对了。
而这恰恰是转行者的优势。
你做了四年 B 端 SaaS,你对那个行业的理解,比任何一个刚毕业的算法工程师都深。你缺的不是业务理解,是把业务理解翻译成 AI 能执行的标准。
评测集就是那个翻译动作。
示范场景:用 AI 筛 AI 产品经理的简历
我建议你拿这个场景练手,理由有三个。
你正在找工作,你比任何人都懂这个场景的痛点。数据你自己就有,你的简历、公开的 JD、网上的简历模板,全是现成的。而且它有点意思:你在用 AI 产品经理的方法,做一个判断 AI 产品经理的东西。
下面五步,我按真实的做法顺序写。

第一步:把场景切小
不要做「AI 筛简历」,太大了。
切到这个粒度:给定一份 JD 和一份简历,输出是否进入面试,以及一句理由。
一个输入,一个输出,一个判断。切不到这个粒度,后面每一步都会崩。
这一步其实就是产品经理的基本功。很多人做 AI 产品做不下去,不是模型不行,是需求根本没切到能被验证的粒度。
第二步:定义什么叫对(最难的一步)
现在写下来:什么样的简历应该进面试。
你会发现自己写不出来。
这不是你的问题,这是所有人的问题。大多数人以为自己知道什么叫好,直到要把它写成一条能被执行的标准。
具体一点,下面每一条你都得有明确答案,不能含糊:
- 「有 AI 项目经验」算数吗?自己做的个人项目算不算?跟着课程做的作业算不算?
- 转行者要不要一票否决?如果不否决,什么样的转行者可以过?
- 学历卡不卡?卡到什么程度?
- 简历里写「熟悉大模型 API」但没有任何项目支撑,算加分还是减分?
这一步会卡住你好几天。大部分人在这里放弃。
但这一步就是全部的价值所在。你在这里花的每一小时,都是别人抄不走的。
第三步:造数据
不需要几千条。50 到 100 条就够用了。
配比建议:
- 40% 明显该过的
- 40% 明显不该过的
- 20% 边界模糊的
那 20% 边界样本才是评测集真正的价值。明显的谁都能判对,模型之间拉不开差距。你后面会看到,所有模型的差异都集中在这 20% 里。
第四步:自己先标一遍,隔一周再标一遍
这一步很多人跳过,它是最能暴露问题的。
如果你两次标出来的结果对不上,说明你的标准还不清楚,回第二步重写。
第五步:拿几个模型跑一遍
同一套题,跑 GPT-5、Claude、K3、再加一个开源小模型。
你会得到一张表:哪个模型在哪一类边界样本上错得最多。
这张表就是你的作品。
说清楚代价,别只讲好处
这件事有三个真实的坑,说在前面。
第一,它很枯燥。认真标 100 条简历,两三天没了,而且中间没有任何正反馈。
第二,第二步会卡住你。前面说了,大部分人死在这里。
第三,你标出来的标准可能是错的。你以为该过的简历,真正在招人的面试官可能不这么看。所以最好找一个真在做招聘的人,拿你的边界样本对一遍。这一步能让你的评测集从「我的偏好」变成「行业的标准」。
还有一个不适用场景要说清楚:如果你对这个场景本身不熟,评测集建不出来。评测集的前提是懂业务,不是懂 AI。你不熟的领域,硬做出来的评测集是错的,还不如不做。
面试的时候怎么用
别说「我做了一个评测集」,这句话没有信息量。
这么说:
我发现 AI 筛简历这个场景,难点不在模型能力,在标准定义。我自己标了 100 条,其中 20 条是边界样本。四个模型跑下来,差异最大的是「个人项目算不算项目经验」这一类判断,而这恰恰是业务方最在意的。所以如果我来做这个产品,我会先把这 20 类边界情况固化成规则,剩下的交给模型。
这段话里有输入,有产出,有判断,有取舍。它比任何一句「熟悉主流大模型 API 调用」都值钱,因为后者三个月就能学会,前者证明你真的想清楚过一件事。
六、为什么这才是真差异化:换模型的速度
前面讲的都是评测集怎么建。这一章讲它为什么值钱。
模型两个月一代。今天你选的那套最优搭配,两个月后一定不是最优的。
没有评测集的团队,遇到新模型是这样的:先凭感觉试几个 case,觉得好像更好,小范围灰度,观察一周,出点事回滚,再来一遍。一到两个月,而且全程没人敢拍板,因为没有一个人能说清楚新模型到底比旧的好在哪、差在哪。
有评测集的团队,是这样的:跑一遍,两天出结论,该换换,该退退。

在一个模型两个月一代的行业里,两天和两个月的差距,就是差异化。
而且评测集有一个提示词永远没有的性质:它越用越值钱。
提示词是一次性的,模型一换就作废。评测集反过来,模型换了它更值钱,因为它是唯一能告诉你「这次换值不值」的东西。
更重要的是它会长大。每次线上出错,你就往里补一条。一年之后,这份评测集里记录的是你这个业务踩过的每一个坑,那个东西没人能复制,因为它不是知识,是经历。
回到第一章那个结构:芯片可以被替代,CUDA 不能。提示词可以被替代,评测集不能。
七、回到那个问题
回到开始的问题。
模型都开源成这样了,那 AI 产品经理到底做什么?
我的答案是:正好相反。模型对所有人一样了,你才第一次真正重要。
模型能力还在快速拉开差距的时候,产品做得好不好,很大程度上取决于你接的是谁家的模型。那个阶段产品经理确实没那么关键。
但能力拉平之后,剩下能拉开差距的,全是只有懂业务的人才能做的事:
什么叫做对了。哪些场景值得做。哪里可以省,哪里一分不能省。错了之后由谁兜底。
这些问题模型答不了,它只会执行你的定义。你定义得糊,它就做得糊。
所以你的差异化从来不在你用了哪个模型,在你比别人更清楚你的场景里什么叫做对。
八、你的 CUDA 是什么
那封联名信里,黄仁勋写了一句被引用得不多的话,我认为那是全信最关键的一句:

强大的人工智能生态系统并非必然结果。政策制定者有重要机会采取行动。这包括扩大初创企业和研究人员对计算资源的访问,投资于共享训练资产(数据集、工具、评估框架),并通过避免对开放模型过早施加限制来保持前沿的多元化,这些限制可能会抑制竞争或推动创新海外。这些措施还必须考虑如何通过强大的应用层来扩大人工智能在国民经济中的主权应用。
他真正怕的不是别人的模型变强,是全世界的开发者习惯在别人的生态上写代码。
芯片可以被替代。CUDA 不能。所以他护的是 CUDA。
你也一样。模型可以随时换,你对场景的判断不能。
黄仁勋在护他的 CUDA。
你的 CUDA 是什么?
本文由 @思敏 原创发布于人人都是产品经理,未经许可,禁止转载
题图来自Unsplash,基于CC0协议
该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。
- 目前还没评论,等你发挥!

起点课堂会员权益



