Gemini 4 Argon 发布

0 评论 725 浏览 0 收藏 15 分钟

Google 凌晨发布 Gemini 4 Argon,19 项测试拿下 14 项第一,单次输出上限从 64K 直接拉到 100 万 token,还首次在 Vals Index 经济价值榜登顶。它已在 Google 内部迁移 C/C++ 到 Rust、优化数据中心内存。本文拆解这份成绩单背后的能力跃迁与分阶段开放策略。

今天凌晨,Google 发布了新一代前沿模型 Gemini 4 Argon,达到了前沿水平

Google CEO Sundar Pichai 第一时间在 X 上发帖,一并贴出了这张成绩总表:

Argon 把单次输出上限从上一代的 64K token 提到了 100 万 token。推广期价格是每百万 token 输入 2 美元、输出 10 美元

但需要注意,现在 Argon 还没有全面开放它会先通过 Google 的 Fairwind 计划交给一批受信任的网络防御者,同时进入美国政府的模型发布前评估流程;之后会从付费 API 用户和 Google AI Ultra 订阅者开始,陆续开放给开发者、企业和普通用户

成绩

总表里,Argon 和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 比了 18 项测试、19 个分项,覆盖知识工作、Agent 编程、机器学习工程、科学与数学、长上下文、电脑操作、多模态理解和网络安全19 个分项里,Argon 拿下 14 项第一(CWE-bench v1 与 GPT-6 Astra 并列)。另外 5 项的第一分别是:FrontierSWE v2(GPT-6 Astra,65.5%)、Terminal-Bench 4.0(Claude Opus 5.5,66.4%)、PostTrainBench(Claude Opus 5.5,49.3%)、Terminal-Bench Science 0.1(GPT-6 Astra,68.1%)和 OSWorld-2.0(GPT-6 Astra,72.6%)

Argon 的成绩都是通过 Gemini API、在最高思考档位下测的单次结果(pass@1),不做多数投票,也不并行多次采样;其他模型的分数多数取自各家自己公布的数字或公开榜单

编程方面,Argon 在 DeepSWE v1.1 上拿到 77.9%,刷新了这项测试的最好成绩。这项测试考的是真实世界里的长周期软件工程任务,GPT-6 Astra 是 74.1%,Claude Opus 5.5 是 74.2%

DeepSWE v1.1:长周期软件工程

Google 的工程师已经在日常工作里用 Argon,从平时的调试,到大规模代码库迁移,再到算法设计。Vibe Code Bench 上 Argon 是 91.9%,其他三家都在 90% 上下

编程之外,Argon 是 Vals Index 上排名第一的模型。Vals Index 覆盖金融、编程、法律和税务工作,每个行业按它对美国 GDP 的贡献加权,用来衡量模型的经济价值。Argon 得分 68.9%,Claude Opus 5.5 是 67.0%,这也是 Gemini 第一次在这个榜单上排第一

Vals Index:按 GDP 加权的综合测评

分行业看,Vals Finance Agent v2 测的是多步骤的金融研究与分析,Argon 拿到 65.4%,比第二名 Claude Fable 5.1 高 6.5 个百分点

Vals Finance Agent v2:金融研究与分析

法律方向用的是 Harvey 的 Legal Agent Benchmark,考长周期的法律研究和文书起草。Argon 拿到 19.6%,其他三家都没超过 7%

Harvey’s Legal Agent Benchmark:长周期法律工作

AutomationBench 是 Zapier 做的测试,看模型能不能在企业核心业务流程里把一件事从头做到尾。Argon 以 51.3% 排名第一,Claude Opus 5.5 是 42.5%

AutomationBench:企业工作流自动化

Argon 在需要看图、看视频的知识工作上也比较强,能做专业的图表分析,能从长视频里找到细节,也能根据一系列文档采取行动。长视频理解测试 LVBench 上,它拿到 91.7%,是目前最好的成绩;图表理解 Chartography 是 71.6%长上下文测试 GraphWalks 里,256K 到 100 万 token 的分项,Argon 是 84.2%,GPT-6 Astra 是 71.8%,两款 Claude 在 65% 上下

100 万 token 输出

为了让 Argon 能做更长、更复杂的任务,Google 把它的输出上限从上一代的 64K token 一下子提到了 100 万 token。Google DeepMind 在 X 上这样介绍:

输出余量大了,模型可以在一条执行轨迹里思考、生成几十万 token,把难题一次做完,推理也更深一层

Google 内部在用

Argon 已经在支撑 Google 的内部工作,数千名 Google 员工提到了它在专业编程任务、深度研究和写作质量上的长处。比如:

  • 量子算法优化:帮量子计算研究员优化关键应用中瓶颈子程序的时空资源(量子比特数 × 门数)。其中一个例子里,它几分钟就把已发表的基线成绩提升了 40%
  • 内存效率:一组 Argon Agent 分析了整个服务器集群的性能剖析数据,自主找出并实施了 Google 各数据中心的内存优化。已上线的部分释放了超过 300 TiB 内存,预计总共能省下 500 TiB 到 1 PiB
  • 大规模代码迁移:Argon Agent 正在把 Google 各处的 C/C++ 代码库迁移到 Rust,规模从 re2、libgav1 这类核心库的几万行,到 Fuchsia Zircon 内核的 80 万 行以上。很多系统非常关键,这些重写在上线前都要经过严格的自动化和人工审计、模拟测试和代码审查

libgav1 是 Google 开源的视频解码库。Argon Agent 拿一个现成的 Rust 移植版做起点,跑了很多轮基于性能剖析的实验,研究编译器的输出,写出编译器能自动向量化的安全 Rust 代码,替换掉了 3.2 万行 SIMD 代码最终得到一个内存安全的视频解码器,速度是原 Rust 移植版的 2.7 倍,解码输出完全一致,和高度优化的 C++ 版本更接近了

网络安全

Google 专门训练了 Argon 的网络安全防御能力,它可以自主发现、验证并修补关键软件漏洞。修复漏洞的测试 CWE-bench v1 上,Argon 以 68% 并列第一,延续了上个月 Gemini 3.8 Flash Cyber 在 CWE-bench v0 上的表现

CWE-bench v1 排行榜

发现漏洞方面,Argon 比 Gemini 3.8 Flash Cyber 进步明显。Google 内部的真实漏洞发现测试,覆盖 20 种编程语言的复杂代码库,看模型能否在源代码里扫出已确认的历史漏洞,Argon 是 85.8%,3.8 Flash Cyber 是 71.0%Wiz 的内部渗透测试基准不给源代码,只让模型分析线上运行的网站,Argon 在发现攻击面、找出漏洞、写出概念验证上都超过了 3.8 Flash Cyber,得分 70.9% 对 58.2%

漏洞发现:真实漏洞扫描与 Wiz 渗透测试

Wiz 已经在它的 Scan for Good 项目里用上了 Argon。这个项目免费帮关键公共基础设施找出并修复高风险暴露面。早期测试中,Argon 在全球多家医院使用的医疗软件里发现了一个严重漏洞,会泄露敏感个人信息,此前的前沿模型都没找到

面向受信任的防御者和 Google 内部团队,Argon 会以不带网络安全护栏的版本提供,让他们用上完整的漏洞攻防能力。渠道就是 Fairwind 计划,目前有 650 多家合作伙伴,优先面向政府和国家网络安全机构、医疗电信能源金融等关键基础设施运营方,以及核心技术平台合作方可以单独用 Argon,也可以把它接进 Google 的代码安全 Agent CodeMender。使用有不少约束:只能做授权的威胁模拟、逆向工程、恶意软件分析这类防御和学术研究任务;只能给内部的安全、应急响应和渗透测试团队开权限,并记录员工的访问和使用;不能转售或分享访问权限。通过 Gemini Enterprise 托管调用时,支持零数据留存

安全防护

在全面开放前,Google 还在加强四方面的防护:

  1. 防滥用:模型会拒绝帮助网络攻击和化学、生物、放射性、核(CBRN)攻击的请求,同时保留正当的两用科学研究。这次还改进了监测模型内部激活来识别滥用的技术,并由内外部红队用人工和自动化攻击做了鲁棒性测试
  2. 防提示注入:Argon 是 Google 目前抵御间接提示注入最强的模型,在 Gray Swan 的间接提示注入(IPI)测试里排名第一
  3. 监测失准:部署监控 Argon 思维链和行动的机制,发现它为完成任务越出用户意图时,必要时中止执行。训练过程也用了类似的系统监控,并且刻意不把监测结果回灌进训练,避免模型学会规避监控
  4. 加固系统:高风险训练或评估开始前,把沙箱环境隔离并封闭起来

Gray Swan IPI 测的是攻击者尝试多次后,注入攻击成功的比例,越低越好。尝试 15 次时,Argon 的攻击成功率只有 0.7%,Claude Opus 5.5 和 Claude Fable 5.1 都是 1.0%,GPT-6 Astra 是 8.5%

Gray Swan 间接提示注入测试:攻击成功率

Google 还呼吁同行在能力快速提升的这段时间保留推理过程的透明度,让模型的思考过程继续能用来发现和诊断失准问题

价格与上线

Argon 推广期的价格是每百万 token 输入 2 美元、输出 10 美元,缓存输入比输入价便宜 95%。推广期结束后,价格调整为输入 4 美元、输出 20 美元。负责 Google AI Studio 和 Gemini API 的 Logan Kilpatrick 发帖时,特意点出了推广价:

开放节奏上,Google 采取分阶段的做法:先交给 Fairwind 计划里的网络防御者和受信任的测试者,同时参加美国政府自愿性质的发布前模型评估;收集反馈、迭代完防护措施后,会从付费 API 用户和 Google AI Ultra 订阅者开始,开放给开发者、企业和消费者

Sundar Pichai 在后续的帖子里也提到了这一点:

Google DeepMind CEO Demis Hassabis 说,Argon 在关键能力上是一次巨大的进步:

这次的官方博客由 Google DeepMind 高级副总裁、Google 首席 AI 架构师 Koray Kavukcuoglu 署名。他在 X 上引用 Sundar 的帖子时写道,很多人好奇团队在做什么,所以决定尽早分享:

本文由人人都是产品经理作者【赛博禅心】,微信公众号:【赛博禅心】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!