10 个人拿到 4000 万美元,这家 AI 公司正在让 AI 变便宜
10 个人的 Wafer 刚完成 4000 万美元 A 轮,AMD Ventures 也在跟投名单里。它让智能体接手最稀缺的性能工程:一段 GPU 程序经过七轮迭代提速 9 倍,每月超 2 万亿 token 在其推理服务上运行。模型竞赛的下一站,可能藏在推理账单里。

9 月 1 日,旧金山创业公司 Wafer 宣布完成 4000 万美元 A 轮融资。Marathon 与 Chemistry 共同领投,AMD Ventures、Wing、Outset Capital 跟投,Fifty Years 和 Y Combinator 再次出资。
这家公司在 Y Combinator 页面上登记的团队规模只有 10 人。四个半月前,它刚公布一笔 400 万美元种子轮。两轮公开融资加起来 4400 万美元,最新一轮的金额是种子轮的 10 倍。
如果只看融资,这很容易被写成又一家 AI 基础设施公司拿到了钱。我们把 Wafer 过去一年的产品、测试和客户案例放在一起看,发现投资人押注的是一条更具体的产品路线。
AI 生成内容以后,另一批 AI 正在接手运行模型时最枯燥、最昂贵的性能优化。
Wafer 想做的事情可以用一句很直白的话解释。模型已经训练好了,芯片也已经买了,它负责让同一套东西跑得更快、更便宜。

Wafer 宣布完成 4000 万美元 A 轮融资
01 十人融资
Wafer 由 Emilio Andere 和 Steven Arellano 创办,两人是芝加哥大学同学,也做过室友。按照公司在种子轮公告里的介绍,Arellano 曾在 Google 参与 Bard 基础设施,也在 Two Sigma 做过性能工程。Andere 曾在阿贡国家实验室训练天气模型,并发表过机器学习安全研究。
他们 2025 年加入 Y Combinator 时,产品介绍还很窄。Wafer 被称作「CUDA 领域的 Cursor」,用户交给它一段运行缓慢的 PyTorch 程序,智能体尝试把它改成更快的 GPU 程序。
一年以后,Wafer 已经把自己定义成推理服务商。公司如今既交付优化后的程序,也提供托管和专用推理服务,替客户选择模型、推理引擎、底层程序和芯片组合。
融资规模跟着产品范围一起变大。联合创始人 Arellano 9 月 1 日在公开帖中称,公司原本准备融资 1800 万美元,最后拿到了 4000 万美元。公司公告没有披露估值。《The Information》援引知情人士称估值超过 2 亿美元,Andere 没有确认这一数字。
这笔钱里还有一个值得留意的名字。AMD Ventures 参与了本轮融资。Wafer 的产品能让 AMD 芯片在具体模型和工作负载上跑得更好,这对 AMD 有直接价值。它卖给客户的是推理服务,也在替另一家芯片公司补软件优化。

Wafer 当前把吞吐量和延迟放在同一套优化空间里
02 稀缺工种
为什么一个性能优化工具需要 4000 万美元?答案藏在一种普通读者很少听说的工作里。
大模型训练完成以后,还要在 GPU 上一枚一枚地生成 token。相同的模型和相同的芯片,换一套底层程序、批处理方式、显存安排和调度策略,速度与成本可能差出几倍。
这像一家餐厅已经买好了灶台,也确定了菜单。出餐速度仍然取决于厨师怎样摆放原料、怎样安排炉火、哪几道菜一起做。芯片是灶台,模型是菜单,性能工程师负责那套后厨流程。
Wafer 在种子轮公告中称,全球能深入优化加速芯片的人可能只有几百名。这个数字来自公司自己的判断,外部没有统一统计。不过人才稀缺这件事很好理解。工程师要读芯片指令文档、分析程序运行记录、改底层代码、检查结果是否正确,再把每种方案放到真实硬件上测速。
芯片还在不断分化。NVIDIA 有 CUDA,AMD 有 HIP,AWS 有 Trainium。每一代硬件都有新的指令、显存结构和限制。通用编译器可以让程序跑起来,却很难及时替每个新模型找到最省钱的组合。
Wafer 选择复制的正是这类人的工作过程。智能体阅读芯片资料,观察程序在什么地方变慢,提出修改方案,写代码,检查答案,再跑一轮测试。失败的方案丢掉,跑得更快而且结果一致的方案留下。

稀缺的性能工程工作被拆成可重复的优化流程
03 七轮提速
今年 1 月,Wafer 公布了一次相当完整的实验。它让智能体优化 AMD AITER 库里的 topk_sigmoid 程序。这个程序参与混合专家模型的路由,负责从许多专家中选出要被调用的几个。
智能体一开始写出的朴素版本需要 899 微秒,速度只有 PyTorch 基线的 0.03 倍。它没有停在这里。它先并行处理不同专家,把时间降到约 15 微秒,再用共享显存做归并,降到 7.56 微秒。
第四个有效版本使用了 GPU 线程之间的快速数据交换,时间来到 4.67 微秒。随后,智能体查看生成的底层指令,发现其中还有 8 次会让线程排队等待的读取。它从 AMD 指令文档里找到广播指令,替换以后只要 3.33 微秒。
最后一个手工调整的汇编版本把归并过程从 30 条指令压到 9 条,耗时降到 3.12 微秒。整段过程在一次会话里产生了 7 个主要版本。

Wafer 随后在 40 组配置上测试了可公开合入的版本。相对 AMD 原来的 CK 实现,提速范围约为 1.31 倍到 1.92 倍。公司公开了相应代码,同时说明最后一个更激进的汇编版本没有合入公开提交,以便保留代码清晰度。
9 倍提速很醒目,实验过程更能说明产品怎样工作。智能体确实走过了性能工程师会走的路。它先得到一个正确但很慢的版本,再读运行结果与指令,逐步找到硬件独有的改法。
04 越过内核
单独优化一段 GPU 程序,可以做出很漂亮的演示,也很难成为一家大型基础设施公司。客户关心的是完整服务能不能更快,流量上来以后会不会突然变慢,以及月底到底要付多少钱。
从 Wafer 官网披露的产品流程看,它当前已经跨过五个层次。系统会同时观察模型结构、解码方法、推理引擎、GPU 底层程序和硬件。每一层都会影响另外几层。
比如,把模型压缩到更低精度可以少占显存,却可能影响结果。把很多请求放在一起处理可以提高总吞吐量,也会让单个用户等得更久。换一张理论性能更高的卡,如果现成的软件没有为它优化,账单反而可能更高。
Wafer 的智能体先用真实流量测试,判断瓶颈来自调度、解码、显存还是芯片匹配。随后,它生成一批候选配置,在目标硬件上逐个测量。输出不一致的方案直接淘汰,速度没有提高的方案也不会进入生产环境。
公司把最后一步设计成持续循环。流量分布变了,模型升级了,或者新一代芯片到货,系统重新观察并寻找下一处瓶颈。
这就把一次性的专家服务变成了持续工作的软件。客户买到一套会跟着业务变化继续调整的推理环境,服务不会在优化报告交付时结束。

Wafer 从底层程序扩展到整套推理服务
05 开始卖云
产品范围的变化,也改变了 Wafer 怎样赚钱。
早期的「CUDA 领域 Cursor」主要服务会写 GPU 程序的工程师。今天的 Wafer 直接向使用开源模型的公司出售接口和专用推理节点。用户可以带着自己的模型与真实流量过来,Wafer 负责找到更合适的部署方式。
公司官网称,它每月处理超过 2 万亿个 token,常见工作负载在同样预算下可以获得 2 到 3 倍的性能,并可以在 24 小时内完成专用节点配置。这些都是 Wafer 自己公布的数据,目前没有统一的第三方审计结果。
推理账单也给了这类产品持续优化的空间。模型刚上线时,团队通常优先保证它能够稳定回答。等请求量从每天几千次涨到几百万次,原先可以忽略的等待和显存浪费会被同时放大。一个只节省几微秒的底层程序,放进几十层模型并被调用数十亿次以后,也会变成真实的 GPU 租赁成本。
客户的流量还会不断变化。白天的语音请求、夜间的批量任务和编程智能体的长上下文,适合的配置并不相同。Wafer 如果只能在上线前优化一次,很快又会落后。它把真实流量持续放回测试过程,商业上才有理由按月收取服务费。
面向个人开发者,Wafer 还推出过按周订阅的 Wafer Pass。入门方案每周 10 美元,每 5 小时可发起 1000 次请求。隐私方案每周 25 美元,请求额度翻倍,并提供不保留数据的选项。它把优化后的开源模型放在兼容 OpenAI 与 Anthropic 的接口后面,让 Claude Code 等编程工具可以直接调用。
这一步很关键。卖优化工具时,Wafer 分享的是工程师的预算。卖推理服务以后,它进入的是每一次模型调用产生的长期支出。
《The Information》援引 Andere 的说法称,Wafer 用 12 周把年化收入做到约 800 万美元,并提到 Vercel 和 Inworld AI 是客户。年化收入是把短期月收入向后推算一整年,不能当作已经收到 800 万美元。报道还称公司毛利率约为 50%,租用 GPU 是一项很重的成本。

Wafer 的产品从优化工具扩展到持续推理服务
06 半秒对话
基础设施题目容易写得离普通人很远。Wafer 最近公布的 Neon Health 案例,把性能优化落到了一个每个人都能感觉到的场景里。
Neon Health 为医疗机构提供符合 HIPAA 要求的语音智能体。人说完一句话以后,系统要把声音转成文字,调用模型,再把回答变成语音。模型迟迟不吐出第一个 token,电话另一头就会出现一段尴尬的安静。
按照 Neon Health 在双方案例页披露的自测数据,把 GLM 5.1 迁移到 Wafer 的专用节点以后,客户端测得的首 token 延迟中位数从 800 毫秒降到约 550 毫秒,降幅约 30%。测试发生在峰值负载高约 25% 的条件下。新的结果也低于双方写进服务协议的 600 毫秒目标。

Neon Health 公布的首 token 延迟变化
250 毫秒听起来很小。在正常对话里,它正好会把「对方是不是没听见」的停顿,变成一句接得上的回答。Neon Health 还把这项指标写进了服务协议,说明速度开始从演示数字变成客户愿意追责的产品承诺。
这也是 Wafer 从底层工具走到推理服务的原因。工程师会为更快的程序买单,语音产品则会为更自然的通话、稳定的高峰表现和明确的服务指标持续付费。
07 AMD 机会
Wafer 目前最显眼的一批成绩来自 AMD 芯片。
今年 6 月,DigitalOcean 与 Wafer 联合公布了一组内部测试。在 8 张 AMD MI350X 或 MI355X 上,Kimi 2.5 面对 1 万 token 输入和 1500 token 输出时,单路生成速度从每秒 22.5 个 token 提高到 255.2 个,达到 11.33 倍。
DeepSeek V3.2 的单请求速度从每秒 38.5 个 token 提高到 200.8 个。并发请求数为 64 时,总吞吐量从每秒 548 个 token 提高到 2165 个。拥有 7740 亿参数的 GLM 5,也被放进单台 8 卡节点,平均生成速度达到每秒 151.1 个 token。
这些成绩来自 DigitalOcean 与 Wafer 的内部配置和测试,不能直接套到所有客户身上。公司也明确提醒,实际结果会受到模型、硬件、流量与使用方式影响。

这组结果至少说明,Wafer 的优化能力与 AMD 的利益方向一致。NVIDIA 的优势来自芯片,也来自 CUDA 多年积累的软件和开发者。Wafer 如果能用自动优化减少软件差距,AMD 的硬件就多了一种进入生产环境的办法。

软件优化正在重新决定不同芯片的可用价值
08 资本押注
4000 万美元远高于一家 10 人软件团队通常需要的工资预算。推理服务需要提前租用昂贵的 GPU,需要在多种硬件上持续测试,也要为企业客户准备稳定性、数据处理和故障恢复。
这让 Wafer 同时拥有两种很不同的公司特征。它的核心研发像软件公司,新增一种优化方法可以反复使用。它的交付又像云服务商,客户每增加一批流量,公司就要准备更多算力并承担运行责任。
因此,这笔融资也像一场抢时间的比赛。Wafer 要在大型云厂商和模型公司补上同类能力以前,把更多芯片、模型和真实流量放进自己的测试系统。覆盖的组合越多,客户第一次接入时需要从头尝试的东西就越少。反过来,如果每个客户仍然要靠工程师手工调几周,智能体只负责写少量代码,公司就很难摆脱昂贵的项目制交付。
投资人押注的部分,在于智能体能否让第二部分越来越像第一部分。过去,增加一个新模型或新芯片,需要重新组织一支性能团队。Wafer 希望让智能体保留已经验证过的工具、资料与实验方法,下一次继续使用。
如果这套能力可以复用,优化产生的收益会累积。今天为 AMD 写出的底层程序,明天可以进入另一家客户的配置搜索。一次失败实验留下的记录,也能减少下一次搜索时间。
风险同样清楚。漂亮的基准测试不等于稳定的线上服务。不同客户的模型和流量差异很大,自动生成的底层程序还要经受正确性检查、安全审查和长期维护。Wafer 能不能把一次次工程突破做成可预测的服务毛利,需要更多公开的客户数据才能回答。

Wafer 要把专家经验变成可以持续复用的软件能力
09 模型降价
过去两年,AI 行业最吸引注意力的是谁能训练出更大的模型。Wafer 代表的是另一条开始升温的路线。模型能力继续提高,使用次数也继续增加,推理成本就会从财务报表里越来越明显地冒出来。
到那个时候,客户未必在意底层程序用了哪条芯片指令。他们会在意语音助手能不能马上回答,编程智能体会不会在高峰期被限速,以及相同预算能完成多少次任务。
Wafer 的产品把这些问题接到了一起。它让 AI 阅读芯片资料、改程序、比较配置,再用真实流量决定哪一个方案值得上线。人负责确定目标、正确性和风险边界,机器负责在巨大的组合里反复试验。
这也是本轮融资最值得关注的地方。AI 公司正在学会用 AI 降低自己的运行成本。以后模型每提高一分,芯片每更新一代,优化系统都可以重新跑一遍。
训练最强模型仍然重要,制造更快芯片也仍然重要。位于两者之间的推理软件,正在拿走更多产品价值。它决定一块芯片究竟能跑出多少性能,也决定一家公司最后要为每次回答付多少钱。
Wafer 只有 10 人,产品能否承受更大规模还没有得到充分证明。4000 万美元已经说明,资本不愿意等到答案完全出现以后再下注。
当智能越来越便宜,推动价格继续下降的,也会是一批会工作的智能体。

AI 推理的竞争从模型能力延伸到每一次调用的成本
资料来源:
Wafer A 轮融资公告,2026 年 9 月 1 日原文 https://www.wafer.ai/blog/series-a
Wafer 技术说明原文 https://www.wafer.ai/technology
Wafer 400 万美元种子轮公告,2026 年 4 月 14 日原文 https://www.wafer.ai/blog/seed-round
Wafer 团队与公司资料原文 https://www.ycombinator.com/companies/wafer
Wafer 的 AMD GPU 底层程序优化实验原文 https://www.wafer.ai/blog/topk-sigmoid-optimization
DigitalOcean 与 Wafer 的 AMD 推理测试原文 https://www.wafer.ai/blog/inference-alpha-amd
Neon Health 客户案例原文 https://www.wafer.ai/cases/neon
Wafer 的推理优化宣言原文 https://www.wafer.ai/manifesto
KernelArena 评测平台说明原文 https://www.wafer.ai/blog/introducing-kernelarena
RuntimeWire 对融资、收入与产品变化的整理原文 https://runtimewire.com/article/wafer-raises-40m-series-a-inference-optimization
The Information 对 Wafer 融资与业务数据的报道原文 https://www.theinformation.com/newsletters/ai-agenda/wafer-inference-provider-uses-non-nvidia-chips-lands-acquisition-offers-200-million-plus-valuation
本文由人人都是产品经理作者【深思SenseAI】,微信公众号:【深思SenseAI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益



