谷歌为何押注RSI?
谷歌发布Gemini 4 Argon,背后是DeepMind对RSI(递归式自我改进)的激进押注。从Dream-RSI到RRSI,谷歌正试图将模型、智能体与基础设施串联成一条自我迭代的生产线。本文深度解析RSI的技术路线、验证难题与资本逻辑,揭示谷歌为何必须抓住这根救命稻草。

“我们的模型正式超越了我。我已经没什么可教它的了。”
9月30日,Google DeepMind研究员Zirui Wang在社交媒体上写道。
当天,谷歌发布Gemini 4系列首款模型Gemini 4 Argon。这是谷歌今年最重要的一次旗舰发布。
这句半开玩笑的感叹,很快引出一个更大胆的猜测:谷歌是否已经实现了RSI?
RSI,递归式自我改进,是指AI参与改进自身或研发下一代AI。
如今,多家公司已将RSI写入研究目标和投资叙事。相关论文、评测和产品也在密集出现。
谷歌是其中投入最大、行动最激进的公司之一。
仅在9月,谷歌就连续公布了四项相关进展,涉及模型研发、搜索策略、智能体工作流等。
密集布局的背后,是谷歌在大模型竞赛中的紧迫感。
不到一年,Gemini从登顶榜单,滑落到被部分用户揶揄为“美国豆包”。
旗舰模型延期,核心人才流失,编程智能体等关键方向又被竞争对手率先定义。谷歌面临的风险,已经从一轮模型落后,变成逐渐失去行业节奏。
RSI像是谷歌必须抓住的一根救命稻草。
据Business Insider报道,谷歌联合创始人谢尔盖·布林对Gemini的进展并不满意,并推动团队将更多精力投入RSI。
面对“AI掉队”的质疑,布林为什么把希望押在RSI上?
众说纷纭的RSI,究竟在争论什么?
RSI看似就是“AI改进AI”,但行业至今没有形成统一定义。
争论主要围绕三个问题展开:
AI究竟能改进什么?一次改进能否降低下一次进步的成本?如何证明改进真实有效?
首先,AI改进的未必只是模型本身。
智能体可以重写提示词、调整工具、优化训练代码,也可以重新设计实验流程。
Anthropic将代码智能体视为RSI的前置阶段。Claude先成为研发助手,再逐步接手程序运行、智能体调用和长周期任务。
在Anthropic看来,只有当模型能够较为自主地完成训练、评估和后继系统开发,循环才算真正闭合。
OpenAI关注的是研究工作可以自动化到什么程度。
9月6日,OpenAI宣布达到“自动化研究实习生”的阶段目标:系统可以在人类指导下,完成边界清晰、原本需要熟练研究者耗时数天的任务。它的下一项目标,是在2028年3月前进化为“自动化AI研究员”。
谷歌的理解更偏向系统工程。
只要AI能够持续改进训练代码、算法、工具链、芯片设计和数据中心调度,并用这些收益缩短下一代模型的开发周期,递归效应就可能出现在整套研发系统中。
其次,反复迭代不等于递归。
AI可以不断写代码、运行测试。如果每一轮的能力上限和工作方式都没有改变,它只是更快地重复劳动。
真正的递归效应,要求一次成功能够提高后续搜索、实验或研发的效率。
例如,训练内核加速,可以缩短下一代模型的训练时间;数据中心释放更多算力,可以支持更多实验;智能体工作流得到优化,则能让同一个模型承担更复杂的任务。
这些改进分散在软件、硬件和组织流程中。正如Google DeepMind研究员姚顺宇所说:“RSI是一个连续光谱,而不是某个突然到来的时刻。”
最后,也是最难的问题,如何验证AI的改进?
代码能否编译、内核提速多少、内存节省多少,都有相对明确的标准。
一个模型是否获得了可迁移到新任务的能力,一套自动生成的训练方法是否真的优于原方案,往往更难判断。
近期,Scale AI推出的RSI Bench、聚焦算法设计的AI4AI-Bench,以及覆盖GPU内核、训练、推理和服务等领域的Φ-Bench,都在测试RSI所需的前置能力。
改进对象、自主程度和验证机制,构成了今天关于RSI的核心争论。
不同公司的答案,也对应着不同的技术路线。
从模型到数据中心,谷歌如何布局RSI?
谷歌对RSI的投入,原本散落在模型、智能体、搜索策略、芯片和数据中心等多个环节。
过去一个月,这些相对独立的技术路线开始汇合。
9月2日发布的Gemini 3.8 Flash,释放了一个直接信号。
谷歌称,长时间运行的智能体循环参与了这款模型的开发。在复杂任务中,智能体反复规划、执行、检查和修复,协助团队完成模型评估与改进。
姚顺宇评价,这是模型能力的“一小步”,却是RSI的“一大步”。
下一步,是减少研发中的无效试错。
9月14日,谷歌与两所美国高校的研究者发布Dream-RSI。
代码智能体为了寻找更快的GPU程序,需要探索多条路线,其中大部分都会失败。如果按照固定策略平均分配算力,系统很容易在没有希望的方向上反复消耗资源。
Dream-RSI相当于为智能体配备了一张持续更新的“探索地图”。
它记录每次尝试的代码、报错、运行时间和最终得分,再从历史经验中判断:哪条路值得继续,哪条路应该及时放弃。
当AI面对类似任务时,它可以少走弯路,把更多算力留给更有潜力的方向。
一周后的9月21日,谷歌云AI研究团队联合三所美国高校发布RRSI,进一步改造智能体的工作方式。
智能体能否完成复杂任务,一定程度上取决于外部Harness。
提示词怎么写、调用哪些工具、任务如何拆分、多个智能体怎样配合,都会影响最终结果。
过去,这套“操作台”主要由工程师根据失败案例手工调整。
RRSI则让AI参与改造自己的操作台:根据任务反馈修改提示词,增减工具调用,重新拆分任务,或调整多个智能体之间的分工。
Dream-RSI解决“往哪里走”,RRSI解决“怎么把活干好”。
它们没有改动基础模型的权重,却能让同一个模型更有效地调用经验、工具和计算资源。
这正是谷歌现阶段推进RSI的思路:
先从模型外围入手,在容易衡量、便于验证的环节积累改进,再把收益带回模型研发。
更早发布的AlphaEvolve,已经将这套思路带入生产系统。
它的运行逻辑,类似一支自动化工程团队。Gemini批量提出候选方案,评估器逐一测试,系统保留表现更好的版本,再围绕这些版本继续探索。
目前,AlphaEvolve已进入谷歌的数据中心、芯片和AI训练流程,用于改进算法、优化训练,并为计算集群寻找更高效的调度规则。
今年7月10日,谷歌将 AlphaEvolve 正式推向 Google Cloud 商用。自动优化也从内部研发工具,扩展为对外平台能力。
至此,谷歌原本独立的技术模块被重新组织。
模型、智能体与基础设施开始彼此连接,散落在公司内部的技术和资源被纳入同一套迭代循环。
一条RSI研发生产线,正在成型。
谷歌为什么必须押注RSI?
对谷歌而言,RSI是一条技术路线,一套资本回报逻辑,也是一次重新争夺行业节奏的机会。
8月初,Google DeepMind首席战略官Jasjeet Sekhon在伯克利Agentic AI峰会上表示,RSI是当前巨额AI投入背后的核心投资逻辑之一。
2026年,Alphabet将资本开支指引上调至1950亿至2050亿美元,大部分资金将用于服务器、数据中心和网络设备。
谷歌必须证明,这些资源不只能服务搜索、广告等核心业务,也能持续提升自身的研发效率。
RSI恰好提供了一种复利:
算力扩大研发能力,更强的模型完成更多实验,实验改善软件和基础设施,升级后的基础设施再支持下一代模型。
谷歌拥有贯穿软硬件与应用场景的完整技术栈,也掌握大量可以自动验证的真实业务场景。
过去,这些业务系统是谷歌的规模优势。进入智能体时代,它们还可能成为模型训练和验证RSI能力的试验场。
此外,RSI也给谷歌提供了一次“弯道超车”的机会。
过去几年的AI竞争已经证明,技术积累不会自动转化为产品领先。
Transformer诞生于谷歌,但ChatGPT率先定义了生成式AI的大众入口。
谷歌长期研究强化学习和推理,OpenAI却更早将推理模型塑造成独立产品类别。
谷歌拥有庞大的代码库和开发者生态,Anthropic则凭借Claude Code率先建立了编程智能体的产品认知。
谷歌一直站在技术前沿,却很少长期掌握行业节奏。
RSI未必能让某一代Gemini突然建立压倒性优势。但它可能把一次性的技术进步,变成滚动积累的研发复利。
如今,几乎所有头部AI公司都在寻找自己的复利引擎,只是路径不同。
Anthropic的优势,是软件工程链条更短。
Claude Code既是产品,也在持续产生真实任务轨迹。用户让Claude阅读代码库、修改文件、运行测试、处理报错。这些过程不断暴露模型的能力边界,并反馈到训练和智能体设计中。
OpenAI的强项,是围绕前沿模型建立了更短的产品决策链。
研究进展可以较快进入ChatGPT、Codex和API。它缺少谷歌那样完整的芯片与数据中心闭环,却能更集中地围绕“自动化研究员”配置资源。
谷歌的弱点,是组织庞大、链条复杂。但RSI也可能将这种弱点转化为优势。
一旦AI能够接手更多实验、工程和协调工作,谷歌过去显得沉重的全栈体系,就可能变成一条更长、更完整,也更难复制的反馈链路。
据路透社8月报道,布林正推动更多资源流向RSI,并敦促核心AI员工全力投入Gemini。
这意味着,RSI在谷歌内部已不只是一个研究课题。它正在实质性地影响资源配置、产品优先级和研发节奏。
谷歌想追赶的,不只是当前最强的模型,更是持续制造最强模型的能力。
当然,今天的RSI距离I. J. Good设想的“智能爆炸”仍然很远。
现阶段,AI只能在人类划定的范围内寻找更优方案。如何评价开放式研究,如何防止系统钻规则漏洞,局部优化又能否真正提升模型能力,都没有成熟答案。
但AI已经进入研发AI的流程,这将逐渐改变整个行业的竞争节奏。
模型、算力和数据之外,一套由AI驱动、能够持续提速的研发系统,正在成为头部公司的核心资产。
模型性能决定一时的排名,迭代速度决定领先能持续多久。
文 / 吴绛枫
本文由 @深流研究所 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Pexels,基于CC0协议

起点课堂会员权益





把RSI当成谷歌的救命稻草,叙事上很顺,但组织复杂既可能是全栈优势,也可能是反馈链路过长。真正要验证的是,外围优化带来的收益能否持续回流到基础模型,而不是只在特定任务上好看。