对抗巨头,你不能只比他好一点点

0 评论 122 浏览 0 收藏 21 分钟

芯片公司 Cerebras 的 CEO 在播客里回忆早期至暗时刻:每隔六周开一次董事会,唯一能汇报的还是做不出来,而公司每个月在烧掉上千万美元。他给出的对抗巨头判断是,比对方好一点点或者便宜一点根本不够用。

做芯片这件事,到底有多难?我最近听了一期播客,Cerebras Systems 的 CEO 兼联合创始人 Andrew Feldman 在节目里讲了一段经历:有整整 18 个月,他们每隔六周开一次董事会,每次唯一能汇报的事情就是“还是做不出来”。而这段时间公司每个月在烧 800 万美元。每次开会,投资人问能帮上什么忙,他的回答是:没什么可以帮的,就等着吧。这不是一家小公司在画大饼的故事,而是一家后来把 AI 芯片做到全球最大晶圆尺寸、拿下美国政府和 OpenAI 作为客户的公司,在早期走过的真实至暗时刻。

Andrew Feldman 在 2016 年创立 Cerebras,这是他的第五家芯片公司。那个时候 AI 还远没有今天这种热度,他看到了 AI workload(工作负载)的计算密集性,判断这是一个可以做出全新架构的机会,然后带着一支有过四家公司经验的老团队,一头扎进去做了。这期节目里,他讲了很多我觉得非常有价值的判断,关于如何对抗行业巨头、硬件公司如何活下来、供应链到底是怎么运作的,以及 Nvidia 真正厉害的地方到底是什么。我把我觉得最有启发的几个部分整理出来,结合自己的思考分享给大家。

攻打巨头,便宜一点或者好一点都不够用

Andrew Feldman 说,如果你要进入一个已经有巨头坐镇的市场,“比对方好一点点”或者“便宜一点”根本不是一个可行的策略。他的理由很直接:Nvidia 的毛利率极高,你就算定价低三分之一,他们随时可以降价、捆绑销售,用一百种方式把你逼死。所以唯一的出路是做出一个好到让对方就算免费送也没法竞争的东西,要快 10 倍、100 倍、500 倍。这不是口号,而是做硬件公司时必须直面的一个冷酷数学题。

他的投资人 Eric Vishria 在节目里补充了一个我觉得非常有说服力的计算框架。他说,假设 Nvidia 每年进步两倍,一家新的芯片公司从创立到规模化至少需要五年,那五年之后竞争对手已经进步了 2 的 5 次方,也就是 32 倍。你至少还需要再有 3 倍的优势,才能在交叉点站得住脚,这就意味着你今天的产品必须比现有方案好 100 倍,而不是 50%。很多人听到有人说“我们要比 Nvidia 快 10 倍”就觉得这是吹牛,但按照这个逻辑,10 倍其实都不够。这让我想到一件事:很多人喜欢说“差异化”,但差异化到底要差异多少,其实是有量化框架的,而不只是一句模糊的方向判断。

Cerebras 的答案是 wafer scale(晶圆级)芯片,也就是整块晶圆不切割、直接做成一颗芯片,面积大概是一张餐盘那么大。这个想法之所以难做,正是因为过去 75 年没有人成功做出来过,行业里有一大批人说这根本不可能实现。Andrew 说他们当时也不确定,但他们相信自己还有想法,还没有把所有思路穷尽,所以就继续做。我觉得这里有一个很重要的心态:不确定能不能成,和认为已经不可能成,是两件完全不同的事。前者可以继续做,后者会让你提前放弃。

只犯新错误,这才是那 18 个月的真正关键

我特别想展开讲那段“还是做不出来”的经历。Andrew 说,那 18 个月里,他们每次做失败了,都会做完整的 failure analysis(失败分析),彻底搞清楚为什么失败,然后确保不会以同样的方式再失败一次。他们内部有一句口号:只犯新错误。

这句话听起来简单,但我觉得它背后藏着一种极其成熟的工程文化。很多团队在遭遇连续失败时,会开始怀疑方向本身,或者陷入某种集体焦虑,把注意力放在“到底要不要继续”这个问题上,而不是“上次为什么失败、这次换什么策略”。Andrew 他们的做法是把每一次失败都当作信息,彻底消化掉,然后带着新的理解继续前进。他描述那段时间的进展时说,最开始晶圆几秒钟就碎了,后来能撑几分钟,再后来有一次跑了一个小时,再后来又回退到几分钟,然后慢慢重新建立起来。2019 年 7 月,他们第一次看到温度曲线稳定下来,站在一个被改造成实验室的小办公室里,盯着一台服务器,意识到他们解决了一个 75 年来没有人解决过的计算问题。Andrew 说那是他人生中最美好的几分钟之一。我相信他说的是真的,因为那种感觉不是来自金钱或名气,而是来自一件原本被认为不可能的事情在你手上变成了可能。

从沙子到一个 ChatGPT 的回答,这条链有多脆

节目里有一段我反复听了好几遍,是 Andrew 解释 AI 芯片的供应链是怎么运作的。主持人问他能不能简单解释“从沙子到一个 ChatGPT 的回答”中间发生了什么,他笑了一下说:其实就是 TSMC(台积电)。

他解释说,芯片制造的核心是 fab(晶圆厂),这是人类能建造的最复杂的东西之一。建一座先进制程的 fab 要花 400 到 500 亿美元,建设周期四到五年,厂房面积是几个足球场大。TSMC 用的光刻机来自 ASML,每台机器大概 50 到 60 英尺长、20 英尺高,一台要半亿美元左右,而且全世界只有 ASML 能造这种机器,这是一个真正的技术垄断,不是人为控制供给的那种垄断,而是其他人根本没有能力复制这项技术。整个过程是:硅锭被切成圆片,也就是 wafer(晶圆),送进 fab,通过光刻工艺把晶体管刻进硅里,最后切成一颗颗芯片出来,然后是 packaging(封装),再组装进服务器,进入数据中心,才到你用的那个 API。Andrew 说,你把一群最聪明的人集中起来花两年时间设计,送进一个造价 500 亿的工厂,出来的是一颗 22 美元的芯片。然后他停顿了一下说:“街边的墨西哥卷饼要 23 美元。”

我觉得这个类比非常有力,它不只是在说芯片便宜,而是在说整条供应链的复杂程度和奇迹感被我们严重低估了。而这条链的脆弱之处在于,需求可以指数级增长,但 fab 的建设速度完全跟不上,因为建一座 fab 需要五年,而且能建的人极少。Andrew 说,美国过去三十年的政策失误把 fab 都推走了,fab 走了之后,给 fab 提供配套服务的工具商、封装厂也跟着走了,整个产业生态就这么空掉了,这是他认为美国犯的一个重大战略错误。我认同这个判断。半导体不只是一个商业问题,它是一个国家能力的问题,当你失去这条链的时候,你失去的不只是产能,而是几十年积累的工程知识和产业人才。

硬件公司的规划逻辑,和软件公司完全不同

Andrew 提到一个让我印象很深的细节。他说在 2016 年创立 Cerebras 的时候,Transformer(变换器架构)还没有发明,当时主流的是 ResNet、TensorFlow,模型非常小,完全不像今天这个样子。他们当时把公司定位在 training(训练)方向,后来随着 AI 的发展,他们做了一个重要的转向:从 training 转向 inference(推理)。

他用了一个比喻来解释他们的决策方式,我觉得非常精准。他说有两种做决策的方式:一种像老式电话线路,提前把整条路规划好,固定不变;另一种像互联网路由器,一跳一跳地走,每到一个新节点,根据当前看到的情况再决定下一跳去哪里。他说他们用的是第二种方式。他们知道终点在哪里,但通往终点的路是看不清楚的,所以每当越过一座新的山头,就重新看一次地形,做下一个决定。

我觉得这对软件创业者来说也很有启发。软件公司很容易养成一种习惯,就是喜欢做长期规划,喜欢把 roadmap(产品路线图)排到一年以后。但在一个底层技术快速变化的环境里,提前把路全部规划死,其实是一种虚假的确定感。真正有效的做法是:知道大方向,但把决策颗粒度细化,每次只赚一个山头的视野,然后再做下一个决定。Andrew 还提到一个关键的架构决策:他们在设计第一款芯片时,没有为 convolutional network(卷积网络)做特化优化,而是选择在更底层的代数层面上做加速,因为他们不知道这种特定的模型架构能撑多久。后来 Transformer 出来了,他们发现自己的架构天然支持,速度甚至最快,而 Transformer 在他们做架构决定的时候根本还没有被发明出来。这是一个非常好的例子,说明“flexibility vs specialization(灵活性与专化)”这个取舍,在硬件里有多重要,而且选错了没有退路。

Nvidia 真正厉害的地方不是 CUDA

这是整期节目里我最喜欢的一个判断,因为它戳破了一个我之前从来没有认真质疑过的叙事。大多数人谈到 Nvidia 为什么成功,都会说是 CUDA(统一计算设备架构),是他们的芯片架构,是先发优势。Andrew 说这些都不是真正的答案。

他说,Nvidia 真正厉害的地方,是那一段没有人关注他们的岁月锻造出来的韧性。大概在 2003 年到 2013、2014 年这十年间,Nvidia 作为一家上市公司,股价表现惨淡,没有人听他们说话,产品很难卖出去,每天都在跟竞争对手死磕,而没有人鼓掌。就是在那十年里,他们把那种绝不放弃的战斗精神刻进了公司 DNA,然后在十年后成为了全球市值最高的公司。Andrew 说,这种在公开市场上十年被人忽视却依然战斗的韧性,才是让他们成为历史上最伟大公司之一的东西,而不是那些技术细节。

我觉得这个视角非常有价值。我们经常喜欢把一家公司的成功归结为某个具体的技术决策或者产品特性,因为那些东西是可以被讲成故事的,是具体的、可复制的。但真正决定长期成败的,往往是一种很难量化的东西,就是在最艰难的时候能不能继续全力以赴,有没有一种文化基因让团队在没有掌声的情况下依然保持战斗力。Andrew 说他自己每天早上醒来都用这种心态面对工作,尽管 Cerebras 现在已经比早年大得多,他依然把自己定位成一个 professional David(职业大卫),永远在跟 Goliath(歌利亚,泛指巨头对手)打。他说他们只对别人做不了的事情感兴趣,只对别人无法完成的挑战感兴趣,这才是他每天起床的动力,不是钱,不是名气,而是把一件别人认为不可能的事情做成。

速度本身就是在创造市场,而不只是赢得竞争

节目里还有一段关于速度的讨论我觉得很值得单独拎出来说。有人问:如果 AI 计算资源始终是稀缺的,那最重要的指标是不是 tokens per watt(每瓦特生成 token 数量)?也就是说,在资源有限的分母下,尽量最大化分子。Andrew 说这个方向是对的,但他强调速度的价值不只是在资源约束下赢得竞争,更大的价值是速度会创造出原来不存在的市场。

他举了一个例子:互联网在慢速时代,Netflix 用信封寄 DVD;当网速变快之后,Netflix 变成了一家电影制作公司。他们不是在寄 DVD 这件事上做得更好,而是网速的突破让他们变成了一个完全不同的东西。他说同样的逻辑也适用于 AI:当你能够即时获得前沿智能,整个应用场景的想象空间就会被打开,而不只是原来的东西变快了。Cerebras 的一个重要方向,是通过跟 AMD 和 AWS 合作做 disaggregation(计算解耦),在保持自身速度优势的同时,大幅提升整体 throughput(吞吐量),据他说跟 AMD 合作已经看到了 5 倍的额外吞吐量提升。

我认为这个“速度创造市场”的思路,在很多领域都被低估了。我们习惯于把速度当作竞争维度,认为更快就是比对手赢了一分,但其实当速度突破某个阈值之后,它改变的不只是竞争格局,而是整个可能性空间。就像网速从拨号变成宽带,不是让下载文件的体验从差变好,而是让 YouTube、Netflix、Zoom 这些东西从根本上成为可能。AI 推理速度的提升,可能也会走这条路。

数据中心的瓶颈,是一场现实世界的慢速危机

Andrew 有一个说法我觉得概括得很准确:AI 在以软件的速度前进,但数据中心在以房地产的速度建设。这两个速度之间的鸿沟,就是我们现在看到的算力供给瓶颈。

他介绍说,从一块空地到建成一个 50 兆瓦的数据中心,顺利的情况下需要 18 个月。如果是 brownfield site(棕地,也就是已有建筑和电力基础设施的旧工业用地,比如废弃的造纸厂或工厂),时间可以缩短,因为电力许可和基础设施已经在了,这也是为什么现在很多公司在抢购锈带(Rust Belt,美国东北部衰落的工业区)的旧工厂。但即便如此,发电机、高压配电开关这些长周期采购物资仍然是卡脖子的环节,根本排不上队。

他还特别提到美国电网的问题:整个基础设施还停留在上世纪四五十年代的水平,完全跟不上 AI 时代的能源需求。他半开玩笑地说,没准是 AI 逼着美国重新认真对待核电,因为其他能源方式根本供不上。关于水耗问题,他也纠正了一个广泛流传的误解:全美所有数据中心加起来的用水量,不到加州杏仁农场用水量的四分之一,数据中心本身用的是闭环冷却系统,水耗问题被严重夸大了。但他同时承认,这个行业在早期没有做好跟地方社区的沟通,没有提前让大家明白数据中心能带来多少建筑就业岗位和长期税收,结果现在在很多地方付出了代价,审批越来越难,这是行业自己造成的问题。

我觉得这个细节很值得关注。技术社区经常犯一个错误,就是认为只要东西是对的、好的,就不需要花时间去解释和沟通。但现实是,公众认知和地方政治会实实在在地影响基础设施的落地速度,这不是软的东西,而是直接决定数据中心能不能按时建成的硬约束。AI 的发展速度越快,这种摩擦就越明显。

我的一点思考

听完这期节目,我最大的感受是:做硬件和做软件,是两种完全不同的创业物理学。软件公司可以今天发现错了,明天就改;硬件公司的每一个架构决策,都要等两三年才知道对不对,而且一旦错了,没有退路,只能从头来。这种不可逆性要求创始人必须在做决定之前想得更深,对方向的判断必须更长远,对不确定性的耐受度必须更高。Andrew 和他的团队能在“做不出来”的状态下坚持 18 个月,不只是因为他们有信念,更是因为他们有一套清醒的方法论:每次失败都做彻底分析,只犯新错误,持续积累对问题的理解,直到走出来。

我也想到另一件事。Andrew 说,Nvidia 真正的护城河不是 CUDA,而是那十年没人关注时练出来的韧性。这让我想起很多我们习以为常的成功叙事,往往都把某个技术决策或者某个产品特性当作成功的核心原因,因为那些东西更具体、更容易传播。但真正把一家公司推到顶端的,常常是一种很难被复制的东西:在无数次可以放弃的时刻,他们没有放弃,而且不只是咬牙撑着,而是每次都在认真学习、认真总结、认真准备下一次。

在 AI 时代,软件的边际成本趋近于零,很多东西可以快速迭代。但这并不意味着“熬过黑暗期”这件事变得不重要了。恰恰相反,在竞争极度激烈的环境里,那些能在没有掌声、没有外部验证的时候依然保持高质量工作的团队,才是最终会走出来的那一批。这是 Andrew Feldman 用十年时间讲给我们的课。

本文由人人都是产品经理作者【深思圈】,微信公众号:【深思圈】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自Pixabay,基于 CC0 协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!