Gavin Baker:所有人都在等 AI 泡沫,但算力还是不够

0 评论 74 浏览 0 收藏 16 分钟

都在等AI泡沫破裂,Atreides创始人GavinBaker却找不到恶化的经营指标。他把争论拉回需求侧:真正高强度用AI的人不到千万,企业内Token消耗呈幂律分布,最积极的工程师是中位数数十倍。文章据此判断算力到底够不够。

AI 基础设施已经成为这一轮科技投资中最重的资本开支之一。围绕它的争论也越来越集中:模型训练、GPU 和数据中心还要继续投入多久,当数千亿美元持续涌向算力,这一轮建设最终会不会走向过剩?

Atreides Management 创始人兼 CIO Gavin Baker 是这场争论里相对坚定的多头。Baker 已经做了 20 多年科技投资,职业生涯早期在 Fidelity 管理科技相关基金,覆盖半导体、互联网和软件等领域,2019 年创办 Atreides。与很多从模型能力出发讨论 AI 的投资人不同,他更习惯从需求、资本回报率和产业供给寻找拐点。

今年 7 月和 8 月,Baker 反复向自己接触到的 AI 公司追问同一个问题:能不能给出一个正在恶化的量化经营指标?至少到目前为止,他没有找到这样的数据点。OpenAI、开源模型和越来越多 AI 产品的使用仍在增长,企业内部真正高强度使用 AI 的人,Token 消耗甚至可以达到普通用户的数十倍乃至上百倍。

这也是 Baker 上周在 a16z 节目中与 David George 长谈时反复强调的反差:今天真正高强度使用 AI 的人可能还不到千万,但算力供给已经受到限制。如果 AI 最终继续向数亿用户扩散,那么在讨论数据中心过剩之前,更现实的问题可能是,现有算力到底够不够。

重度用户不足千万,需求还没扩散

这种差距已经开始出现在企业内部。George 表示,在 a16z 投资组合中,一些技术最激进的公司,每月 Token 支出已经达到人力成本的高个位数比例;部分 AI Native 公司甚至超过 10%。相比之下,一些已经较积极采用 AI 的传统企业,这一比例仍然只有 1% 左右。

同一家企业内部,AI 使用也呈现出明显的幂律分布。最积极使用 AI 的工程师,Token 消耗量可以达到中位数工程师的 10 倍甚至 100 倍。这意味着,目前企业看到的平均 AI 使用量,并不能代表高频用户真正可能达到的消费水平。

Baker 自己管理的 Atreides 已经经历了这种变化。从今年 3 月到 8 月,Atreides 内部 Token 消耗增长约 100 倍。在获得 Grokbot Enterprise 后,他甚至预计,随着更多工作被交给 Agent,公司 Token 消耗还可能出现新的跃升。

背后的变化是,AI 正在从“辅助工作”走向“执行工作”。此前的 Coding Agent、总结工具和搜索产品,大多仍然需要人不断提出任务、检查结果;新的 Agent 已经开始根据已有信息主动提出下一步行动,下一阶段则可能进一步接管部分任务执行。

在一些最先进的工程团队中,AI 完成的代码比例已经从约 20% 提高到 90% 以上。而 Baker 更关注下一步:当 AI 不只是生成一段代码或总结一份文件,还有持续读取信息、制定计划并执行任务时,单个用户能够消耗的计算量可能完全不同。

这也是为什么两人认为,当前 AI 的渗透仍处在很早的阶段。现在的问题已经是:一个真正把 AI 融入工作流的人,最终会消耗多少智能。

数据中心建得还不够

AI 基础设施最终出现泡沫,Baker 并不认为没有可能。铁路、汽车、广播、PC 和互联网都经历过类似周期:新技术出现后,资本快速涌入,估值上涨进一步推动投资,最终形成供给过剩。

但要形成这样的周期,首先需要供给真正超过需求。至少从目前部分算力项目的经济性来看,这一步还没有发生。

根据 Nebius 和 CoreWeave 等公司的相关披露,Baker 估算,Nebius 部分算力项目的投资回收期大约可以做到 9—10 个月;如果按照更高的现货价格变现,回收速度还可能更快。

Baker 表示,在他的投资生涯中,很少遇到能够投入数百亿美元、同时实现一年以内回收期的投资机会。

资本也在帮助这轮建设继续放大。英伟达 GPU 等算力资产已经形成相对成熟的融资市场。Blackstone、KKR、Apollo 等机构可以为数据中心项目提供资金,企业不必完全依赖自己的股权资本完成建设。

模型公司则在另一端不断吸收这些新增算力。Baker 判断,Frontier Lab 短期内很难成为传统意义上的自由现金流机器。它们即使产生大量经营现金流,也很可能继续买入 GPU、XPU,并重新投入训练和推理。

原因在于,模型公司的算力配置直接决定竞争力。假设一家模型公司拥有 10 GW 算力,其中大部分用于推理。如果一次新的训练突破能够明显提高模型能力,公司完全可能主动减少推理资源,把更多算力重新转向训练,即使这样做会暂时牺牲收入。

与传统互联网公司不同,Frontier Lab 的训练和推理直接争夺同一批计算资源,因此它们需要不断在今天的收入和下一代模型之间做选择。

只要 Scaling 仍然能够换来更强的模型,它们就很难停止投入。真正限制建设速度的,反而越来越多来自物理世界。

Baker 提到,AI 基础设施已经开始影响铜、电力、晶圆和数据中心施工等多个产业的产能。按照他的判断,即使把当前规划中的项目全部计算在内,到 2028 年前后,算力供给仍然可能保持紧张。

他也因此把数据中心建设与美国“再工业化”联系起来。新的数据中心需要电工、暖通、建筑、电力设备以及大量工业供应链,AI 的资本开支正在从软件和芯片继续向实体经济传导。

AI 泡沫最终可能出现,但 Baker 认为,现在首先遇到的还是另一个问题:新增产能能不能按计划建出来。

AI 不一定赢家通吃

算力需求继续增长,并不意味着最后只有一家模型公司能够获得价值。这也是 George 和 Baker 与很多 AI“赢家通吃”判断不同的地方。

Baker 把未来的 AI 市场称为一个 “And”而不是“Or”的市场。Frontier Model 可以继续增长,上一代模型仍然可以承担大量任务;开源模型可以增长,应用公司同样可以增长;云厂商、推理平台以及不同的模型公司,也可能同时找到自己的利润空间。

开源尤其容易被误解。模型权重开放,并不会让生成 Token 所需要的计算消失。同样规模的模型仍然需要 GPU、服务器和电力,开源真正压低的更多是模型层的利润率,而不是生成 Token 所需要的计算。

如果智能因此变得更便宜,Token 消耗反而可能继续增加。企业最终采用的技术架构,也未必是“选择一家模型公司”。

Baker 预计,大型企业更可能形成一套多模型系统:企业拥有一个根据自身数据训练或强化学习得到的模型,同时连接一个或多个 Frontier Model,再通过 Router 根据任务复杂程度、成本和能力自动选择模型。

最强的模型可以负责规划和复杂推理,成本更低的模型负责执行。这也把竞争从“谁拥有最强模型”,进一步推向了另一个位置:谁来成为企业调用不同智能的入口。

Microsoft 可以通过 Copilot 争夺这个位置,Databricks、Snowflake 掌握企业数据,Fireworks 等推理平台可以负责模型选择和部署,Salesforce、Workday 则控制具体业务流程。Cursor 和 Harvey 这样的垂直 AI 公司,同样可能从一个具体任务向上扩张。

Baker 提到,Kirkland & Ellis 已表示将投入 5 亿美元自建相关能力。在他看来,这至少说明,企业 AI 的这块市场足够大。

不过,这也不会只是一次性的 IT 项目。基础模型会持续变化,企业自己的模型需要继续训练,不同 Frontier Model 的能力和价格也会改变。Router 必须不断调整整个系统,而用户最好感受不到底层模型发生了什么变化。

因此,企业 AI 的“抽象层”看似只是一个模型入口,真正做起来却需要同时处理模型、数据、推理成本、权限和业务工作流。这会是一场远比“接一个 API”复杂的竞争。

英伟达,站在所有路线中间

如果 Frontier Model、开源模型、应用和云都能增长,有一家公司几乎站在所有路线中间——英伟达。

Baker 对英伟达的判断,已经不再局限于 GPU 性能。他将英伟达当前的策略概括为:垂直整合,但水平开放。

一座大型 AI 数据中心需要的不只是加速器。CPU、GPU、Scale-up 网络、Scale-out 网络、交换芯片、内存和完整机架必须同时工作;背后还需要晶圆、DRAM、NAND、激光器、电容器以及土地和电力。

英伟达正在同时组织这些环节。Baker 认为,这使后来者即使做出一颗性能出色的 AI 芯片,也很难直接复制英伟达的系统能力。这也是他给 AI 芯片创业公司的建议:没有必要一开始就试图取代英伟达。

按照 Baker 自己的经验估算,AI 加速器市场每拿到 1% 的份额,今天可能就值约 1000 亿美元。创业公司完全可以选择一个细分环节,接入英伟达已经形成的生态,而不是重新打造完整系统。

英伟达最大的客户本身也在做竞争芯片。Google 有 TPU,Amazon 有自己的 AI 芯片,模型公司也在开发 ASIC。但这些公司同时仍然是英伟达的重要客户。

这种关系并不矛盾。当模型架构持续变化时,专用芯片可以优化确定的工作负载,而 GPU 的通用性仍然能够覆盖新的训练方法和模型结构。多种芯片因此可能长期共存。

开源模型对英伟达也是类似逻辑。如果开源降低了模型层利润,智能变得更便宜,更多 Token 被调用,最终需要的仍然是更多计算资源。

在 Baker 看来,模型和算力需求越分散,英伟达的位置反而越稳固。他甚至借用了 SemiAnalysis 的一个说法,把英伟达称为 “AI 的中央银行”。

它不仅出售计算资源,还提前锁定晶圆、内存和其他关键零部件,并通过投资、融资安排和数据中心项目帮助更多客户获得算力。在一个供给受限的市场里,能够调动整条供应链本身就成为了一种竞争优势。

下一块算力,可能来自太空

如果地面算力长期供不应求,Baker 已经开始考虑更激进的供给方式——轨道数据中心。

他的判断建立在 Starship 的完全可重复使用之上。地面数据中心除了 GPU 等 IT 设备,还需要承担电力、冷却、建筑和人工成本。Baker 的设想是,如果 Starship 的完全复用把发射成本大幅压低,太阳能供电和辐射散热可能省去地面数据中心的一部分配套基础设施成本。

Baker 并不认为所有计算都会离开地球。训练大型模型仍然需要大量 GPU 以极低延迟连接在一起,光速和通信延迟决定了大型训练集群仍然更适合部署在地面。

但推理并不完全受到同样的约束。因此,他认为轨道计算更可能首先成为地面数据中心之外的补充产能,随后随着发射成本下降逐渐扩大。

这是整场对谈中最激进的一项判断。但 Baker 已经把判断标准压缩到了一个非常具体的问题:Starship 能不能真正做到低成本、高频率的完全复用。如果这个条件成立,在他看来,把服务器送上轨道,就不再只是一个科幻问题,而会开始变成一道基础设施成本题。

本文由人人都是产品经理作者【有新Newin】,微信公众号:【有新Newin】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!