模型能力逐渐趋同,Infra开始成为下半场竞争要塞

0 评论 355 浏览 0 收藏 12 分钟

当模型能力趋同,AI产品的竞争焦点正从模型本身转向基础设施(Infra)。本文用奶茶店类比拆解Infra的构成,分析其成为热词的三大原因,并给出产品经理感知与参与Infra决策的实用方法,助你在技术讨论中不再被动。

一、最近,人人都在聊Infra

最近几周,如果你有在关注AI播客聊的内容,会发现大家不约而同地聊到了同一个话题——Infra。不管是张小珺和Inferact的联合创始人游凯超,还是硅谷101的陈茜和RadixArk的联合创始人盛颖,亦或是十字路口的Koji和Runta创始人戴冠兰,来自各个公司的大佬们都选择在这个时候出来聊Infra这件事。

这不是巧合。这里面到底是什么原因?

二、Infra到底是什么

在聊具体原因之前,我们首先得搞明白Infra到底是什么。

用一个大家都能懂的例子来解释。假设你想开一家奶茶店,你卖的奶茶就是你的产品(对应AI里的模型),但只了解配方是远远不够的,你还需要一整套东西才能真正把奶茶卖出去:

  1. 店面和设备(算力):你的制冰机、封口机、冷藏柜能撑多大出杯量。设备拉胯,高峰期就炸单。
  2. 供应链(数据基建):茶叶、鲜奶、水果从哪来,怎么验收,怎么储存,过期了怎么处理。原料不稳定,口味就不稳定。
  3. SOP和培训(训练平台):怎么让新店员也能做出一样味道的奶茶,而不是全靠老师傅手感。
  4. 出餐和外卖(推理部署):顾客下单到拿到奶茶要多久,外卖高峰能不能扛得住,一杯的配送成本是多少。
  5. 试喝和品控(评估体系):新品上线前怎么测,上线后怎么追踪差评原因。

这些加在一起,就是你这家奶茶店的Infra。

大家平时讨论AI,聊的都是”这杯奶茶好不好喝”(模型能力),但很少有人关心这家店的后厨、供应链和出餐效率。而Infra,解决的就是后面这些问题。

三、为什么今年Infra突然变成了热词

Infra并不是一个新概念,但为什么在今年特别是最近几个月变得格外火热?我觉得有三个原因:模型趋同、场景变复杂、成本压力。

1. 模型趋同

从7月份开始到现在,可以说是一个模型集中喷发的阶段——Fable 5变为订阅计划、Opus 5.0发布、GPT-5.6发布,国内也有Kimi K3、DeepSeek V4 Pro等等。这些模型之间确实还存在差距,但已经远不像当初Opus 4.6那样的断崖领先了。当模型能力越来越趋同,竞争的焦点就自然转向了另一个维度:谁的Infra做得更好,谁就更有可能胜出。

2. 场景变复杂

回想2024年5月GPT-4o刚发布的时候,主流AI产品的形态其实很简单——一个聊天框,你输入文字,它输出文字。这种场景下Infra的压力并不大:一个模型、一次推理、返回结果,完事。

但当时钟拨到2026年的今天,场景形态已经发生了翻天覆地的变化:

1)从纯文本到多模态。 多模态智能体能够理解语音、图像、视频、手势等多种输入类型,这和处理纯文字的算力需求完全不是一个量级。处理视频和高分辨率图像的计算开销远大于文本,需要更大的存储、更高的带宽、更强的GPU,Infra的每一层都要升级。

2)从单轮问答到Agent多步执行。 现在的趋势是让AI不只是回答问题,而是像一个员工一样自主完成任务——比如你说”帮我调研这三家供应商并出一份对比报告”,Agent要自己拆解任务、调用搜索工具、读文档、做对比、写报告。一次用户请求可能触发几十次模型调用、多次工具调用、跨环节的状态管理——Infra要支撑的不再是”一问一答”,而是一整条工作流。

3)从云端到端云协同。 敏感数据在本地小模型处理,复杂任务上云,这种混合部署模式正在成为趋势。Infra的复杂度又上了一个量级——你不只要管云端服务器,还要管终端设备上的模型部署和调度。

一句话:去年的Infra只需要支撑一个”对话”,今年要支撑一整条”生产线”。

3. 成本压力

这一点需要先做一个核心区分:训练成本是项目预算(一次性的),推理成本是运营开支(持续性的)。

训练有多贵?根据斯坦福2025年AI指数报告,谷歌Gemini 1.0 Ultra的训练成本高达1.92亿美元。但训练是阶段性的——你花几个月训完一个模型,这笔钱就花完了。

推理则不一样。模型上线以后,每个像你我这样的用户的每次请求都在消耗算力。单次成本虽低,但每天累积,用户量大时全年推理的运营支出会逼近甚至超过训练成本。而且推理成本很难提前算准——它同时受模型结构、Token长度、服务延迟、并发波动、缓存策略和任务链路的影响。

这直接影响了一款AI产品能不能活下去。推理成本决定了产品的定价和商业模式——为什么有的AI产品免费(靠广告或数据飞轮)、有些按次收费、有些只开放API不做toC?背后很大程度上就是推理成本结构在起作用。

不过也有好消息:成本正在快速下降。而成本下降本身就是Infra优化的结果——更好的推理引擎、量化技术、缓存策略等等,正在推动更多应用场景变得经济可行。这也从另一个角度解释了为什么Infra成了热词:它不只是成本问题的根源,也是解法。

四、Infra强不强,PM怎么感知得到?

说了这么多,你可能会问:我又不写代码,Infra强不强跟我有什么关系?

请想象一个场景:你想让用户上传一段会议录音,AI同时做语音转文字、提取待办事项、生成会议纪要。你觉得市面上的模型都有这个能力了,方案写好了提给技术。

技术说做不了。

原因不是模型不行,而是推理服务扛不住这个链路:语音转文字要调一个模型,提取待办要调另一个,生成纪要又是一个,三个模型串联起来延迟太高,用户要等两分钟。

如果这个时候你不懂Infra,可能就默默接受”做不了”三个字了。但如果你知道瓶颈出在推理调度而不是模型能力,你就可以跟工程师讨论:能不能先把语音转文字做成异步?纪要生成用更轻的模型?待办提取用规则兜底?

再比如,产品路线图上有两个功能,一个是实时对话(低延迟、高并发),一个是离线批量分析(延迟不敏感、但数据量大)。如果你不了解Infra,你只能按用户价值排序。但如果你知道目前的GPU资源和推理架构更适合做离线批处理,而做实时对话需要额外采购推理服务或者重构调度系统——这个信息会直接影响你的优先级判断。

这不是说技术限制应该压过用户价值,而是你需要把实现成本算进优先级公式里。否则排出来的路线图,就是一厢情愿。

五、不用学CUDA,但你需要会问这几个问题

Infra的重要性说到这里,可能有人开始焦虑了:那我是不是得去学一堆技术?

不用。你需要的不是学会具体实现,而是在下次跟技术开会的时候,知道问什么、怎么问,不至于被一句”没法做”给堵死。

当你在评估一个新功能能不能做的时候,问:

“这个功能上线后,单次调用的推理成本大概在什么量级?”——你不需要精确数字,但需要知道是几毛钱还是几块钱,这决定你能不能开放给免费用户。

“瓶颈在模型能力还是在工程链路?”——区分”做不了”是因为模型真的不行,还是当前的部署架构撑不住。前者要等模型迭代,后者可以通过工程优化解决,两个的排期完全不同。

当你在跟工程师讨论技术方案的时候,问:

“这个方案的成本是随用户数线性增长,还是有边际递减?”——同样是一万个用户,有的架构方案成本是一千个用户的10倍,有的可能只是3倍。这影响你的商业模型能不能跑通。

“有没有成本更低但体验只差一点的替代方案?”——比如用更小的模型、做缓存、走异步。PM的价值就在于在体验和成本之间找平衡点,但你得先知道有这些选项存在。

这几个问题不难记,但能问出来,你就从一个”只提需求的PM”变成了一个”能参与技术决策的PM”。在模型能力越来越趋同的今天,产品之间的差距越来越取决于Infra层面的选择——而这些选择里,本来就应该有PM的声音。

本文由 @余量思考 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!