智谱GLM-5.3发布:前沿编程能力与涌现的网络安全能力

0 评论 570 浏览 0 收藏 24 分钟

单弦不成音,独木不成林

今天我们发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。我们发现充分的模型后训练涌现出超出预期的模型能力。相比前代,GLM-5.3的新能力包括:

  • 更强的编程能力。GLM-5.3是编程能力最强的开源模型,在内部自建体感评测中较GLM-5.2提升50%,在包括Terminal Bench 3.0、Agents’ Last Exam (CLI)在内的公开基准测试中取得开源第一。
  • 网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。
  • 后训练Scaling。上述全部提升都来自后训练。基于IndexShare、SAO、以及持续演进的新一代Slime框架,我们在与GLM-5.2完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座的智能上界
  • 开源。我们将在发布两周后开放模型权重,此前完成安全评估与模型加固。

即日起上线智谱官方编程工具ZCode、效率工具AutoClaw,上线GLM Coding Plan全量用户及开放订阅。TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode等编码平台开放抢先体验。API很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

今天13:00,GLM Coding Plan全员额度重置,所有用户后台「用量统计」可见使用额度回满。

强大的编程

在多项主流基准测试中GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。

在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents’ Last Exam上,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力。

整体来看,GLM-5.3在复杂软件工程、终端操作和更广泛的真实世界 Agent任务上均取得非常显著的进步。

自研的Z.ai Code Bench评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用Coding Agent时的体验。

测试结果显示,GLM-5.3在效果和Token利用率之间取得了更好的平衡。在High档位下,GLM-5.3达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%,每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens,意味着GLM-5.3可以用更短的执行路径完成任

GLM-5.3训练过程中,我们不只让模型完成编程题,而是把训练环境扩展到更接近真实专家工作的完整流程,有些任务的工作量相当于一位工程师连续数天的工作。以机器学习优化任务为例,模型使用与算法工程师相同的计算集群、存储系统、内部文档、代码库和实验结果,端到端实现可量化的提速。

在这样的环境中训练,模型学到的不只是单向执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作。

涌现的网络安全能力

在任务环境不断扩张的过程中,我们观察到模型在网络安全领域的表现超出预期。安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。我们从2025年9月开始在这个方向投入研究,在GLM-5.2与GLM-5.3的研发过程中,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架(harness)。

从任务链条看,网络安全能力大致包括代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行了全面评估,GLM-5.3当前优势主要集中在前半段。

在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%

在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因,并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。

ExploitGym考察模型在限定时间内能够完成多少漏洞利用任务,按吞吐量对预算进行归一化后,GLM-5.3在两小时内完成105项任务,六小时内完成130项,相对于GLM-5.2分别完成29项和39项提升巨大。Mythos 5仍然领先,两个时间段分别完成181项和247项。

三个基准呈现出相同的趋势:越接近漏洞利用链的前端,GLM-5.3相较GLM-5.2的提升越明显;越深入完整利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。换句话说,GLM-5.3进步最快的方向,正是当前仍需要重点追赶的方向。

1 安全评估成果

从GLM-5.2发布以来,我们联合国内清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队,开展了密集的红队测试与安全评估。累计发现漏洞2,436个(经过初筛、去重),其中1,097个为中高危,许多漏洞多年来甚至几十年都未被发现,最早可追溯至约45年前。

代表性漏洞覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目,部分漏洞的威胁甚至可以让Android、Windows、macOS以及某国民级通信软件出现大范围崩溃。

这些发现已发展成为一项持续的漏洞发现和披露工作。相关漏洞已陆续提交CNNVD/CNVD等国家漏洞库。为提高披露过程的透明度,我们建立了Z.ai安全披露账本,记录漏洞从发现、确认到修复的进展。账本将持续更新,为了确保负责任的安全披露,我们仅公开已经经过披露和厂商修复的漏洞,对于那些仍处于协调披露阶段的漏洞,我们会展示漏洞的哈希值以供后续核验。

参考Zerodium、Crowdfense、Apple Security Bounty、Pwn2Own等全球漏洞交易与赏金市场公开报价,这些漏洞创造的经济价值达3000万元。

2 抱抱脸的故事——网络安全能力必须更加开放

Hugging Face官方披露事件给出的警示:如果强大的攻击能力正在扩散,防守能力就不能只在少数闭源模型公司。闭源模式将前沿安全能力异化为少数机构的特权,Anthropic向约150家大型机构提供Mythos模型及安全服务,更广泛的企业和开源项目则难以获得同等水平的安全能力支持,甚至会在遭遇攻击、最需要帮助的时候,被闭源模型拒之门外。

没有开源反而是这个时代最不安全的事情。随着GLM-5.3的发布与开源,我们将同步启动“开源的盾”计划:

1.对重点开源项目开展持续安全审计,帮助维护者免费发现和修复风险https://huggingface.co/spaces/zai-org/OpenVuln

2.向开源社区免费提供模型额度及更加便捷的防御入口,开源项目维护者可以申请用于安全审计和防御任务

3.在ZCode中提供代码审计功能,让安全检查进入日常研发流程

当最强的矛被锁在少数人手里,最好的盾必须属于所有人。我们会持续优化GLM安全能力并坚持开源,与全球开发者、安全研究人员共同建设一套持续生长的防御体系,让前沿模型从少数机构的特权,转化为服务开源社区的安全公共品。

3 一个小插曲:追凶neo

2026年7月,一台位于巴西的临时文件服务器进入Ferret的监测范围。Ferret是GLM-5.3首批合作伙伴FOFA的追踪分析引擎。GLM-5.3很快发现,这并不是一台普通服务器,目录中出现了大量攻击基础设施信息。

继续分析后,一个名为“Neo”的AI Agent浮出水面,其目标是攻击A国的会计师事务所、税务服务公司和记账机构。

Neo获得了很高的系统权限。不到两个月,它管理着4台服务器、7个域名、6万个邮箱和100多个脚本,发出18567封钓鱼邮件。面对数千个开放目录、数万份日志和高度碎片化的攻击线索,仅靠人工几乎不可能发现其中的关联。

GLM-5.3迅速提取关键线索,关联攻击,并辅助安全研究人员还原出整条攻击链:攻击者如何搜集A国会计行业目标,搭建邮件系统,直至伪装成企业客户和行业机构,准备后续恶意文件,最终有效帮助Ferret捕获该攻击。

这与此前Hugging Face安全事件形成了呼应。在Hugging Face事件中,前沿模型逃逸发起攻击,GLM-5.2被部署到本地帮助完成取证;在这次事件中,Agent为攻击方工作,GLM-5.3又帮助防守方从证据中还原攻击链。

同样是模型,站在哪一边,取决于掌握它的人与目的。

4 最好的安全,是事故最终没有发生

潜在风险离我们并不遥远。从一条消息、一封邮件,到互联网的底层协议、机器人,数字世界的安全边界早已连接着个人设备、企业网络、互联网基础设施甚至是真实世界,影响着我们每一个人。GLM-5.3作为“开源之盾”的意义,就是要帮助更多安全团队抢在攻击者之前发现风险,让风险在影响用户之前化解和修复。

保护Cursor,守住开发者的工作台

Cursor是全球数百万开发者日常使用的AI代码编辑器。在一次模型能力评估中,清华大学NASP实验室借助GLM-5.3,对Cursor的二进制代码、跨语言架构和权限边界展开分析,发现其Rust与Electron混合架构及权限校验逻辑中存在潜在失陷风险。攻击者可能借此实现任意文件写入,进一步窃取敏感信息,甚至接管开发环境。

这一风险隐藏在复杂的程序逻辑中,无法通过孤立检查单个代码缺陷发现。挖掘过程中,GLM-5.3深度参与逆向分析全流程,协助安全研究人员还原程序逻辑、定位异常路径,并从大量候选路径中排除干扰,最终在授权测试环境中完成风险验证。目前,安全研究团队也已联系Cursor方面推进修复,漏洞已上报CNVD和CNNVD。

保护国民级通讯APP,守住数亿人的设备安全

安全研究人员在一款拥有数亿日活用户的国民级即时通信软件中发现异常。攻击者无需诱导用户点击链接或打开文件,只需发送一条看似正常的消息,就可能在用户几乎无感知的情况下触发漏洞,进而让用户失去设备控制权。整个过程可以远程完成,且具有较强的稳定性和隐蔽性。

该漏洞深藏于自研私有协议、内容处理逻辑与内存管理机制之中,触发条件涉及复杂状态机和极难复现的时序问题。由于缺少公开资料,安全研究人员借助GLM-5.3,从海量二进制代码中定位异常、还原逻辑,并逐步完成路径验证。最终,这场可能波及数亿用户的安全事件没有发生,风险在抵达用户之前就被发现并拦了下来。

保护DNS基础设施,守住互联网的“导航系统”

DNS如同数字世界的“北斗导航系统”,一旦大面积瘫痪,全球的网站、邮件和云服务都可能因无法找到正确地址而无法运行。

清华大学NISL实验室与云起无垠安全研究团队借助GLM模型,在诞生于1983年的DNS协议中,发现了一类潜伏40余年的关键协议级漏洞。与常见的软件漏洞不同,这次发现的是互联网底层协议规则本身存在的问题。攻击者只需发送少量特殊请求,就能将服务器的计算压力最高放大近8万倍,进而导致网站无法访问、邮件中断和云服务失效。

根据网络测绘估算,该漏洞可能影响全球九成以上的主流DNS系统,涉及超过1000万处公网DNS服务。GLM协助安全研究人员提前发现这一底层风险,为DNS系统的修复与加固提供依据。也意味着GLM的安全能力也由软件代码审查进一步延伸至互联网基础协议,开始参与保护整个数字世界赖以运行的基础设施。

保护邮件与办公系统,化解微软全球级安全事件

一次邮件预览,险些成为进入企业网络的入口。赛博昆仑借助GLM模型发现三枚微软重大漏洞,涉及全球用户每天使用的邮件与办公系统,覆盖客户端邮件预览、文档处理和服务端远程访问等多个环节。这些漏洞串联成“客户端预览即中招、服务端可被远程攻破”的攻击路径,相当于攻击者可能通过一封邮件进入用户终端,再以终端为跳板渗透企业网络,使相关产品的大量用户和部署环境面临风险。

历史上同类漏洞曾在全球范围造成严重损失,例如在2021年的ProxyLogon事件中,大量的Exchange服务器沦陷。目前,安全研究团队已经将三大漏洞提交微软并完成修复,微软官方致谢了“Kunlun Lab&GLM”,意味着一场可能波及全球用户和企业的安全事件被提前化解。

保护真实世界,提前阻断人形机器人失控风险

DARKNAVY·深蓝研发的安全AI系统deepsec借助GLM模型,在一家全球顶级具身智能机器人厂商的系统中发现致命级漏洞,攻击者一旦利用该漏洞,可能同时远程劫持上千台机器人,并控制其执行恶意动作。

面对由多套独立安全系统组成的复杂架构,deepsec将顶尖安全研究员的经验工作流与GLM模型的长程网络安全任务执行能力结合起来,从机器人的公开文档出发,完成信息收集、静态分析、漏洞挖掘和风险验证,逐步还原系统逻辑、梳理安全边界,最终定位并确认了这一关键风险。

随着漏洞得到修复,一场可能影响真实世界的“机器人集体失控”事故被提前阻断。GLM保护的不再只是代码、终端和网络,也开始延伸到与真实世界直接互动的智能设备。

上述漏洞均已联系厂商进行修复,已进入国家CNNVD/CNVD国家漏洞库负责任披露与协同修复流程。

有责任的开源

随着模型能力提升,我们同步强化安全体系,以便先进智能能够继续广泛发挥作用,同时对最高风险用途施加更严格的审查。针对GLM-5.3,我们构建了迄今为止最稳健的风险审查系统。

GLM-5.3的风险审查系统采用了分层设计,横跨外围API到模型内部,以提高准确性与冗余度,这遵循了安全防护体系中纵深防御的基本原则,即从不假设某一层防护是完美的,而让多层相互独立的防线彼此冗余,共同组成鲁棒的防护系统。

  • 外层分类器(classifier flag):用轻量模型标记并拦截大规模滥用请求;
  • 推理监控器(reasoning monitor):在模型推理过程中实时审查任务意图,判断是否存在潜在危害;
  • 深度安全对齐:让模型从根本上自主识别并拒绝攻击性请求,这也是开源权重场景下唯一仍然有效的防线。

在设计分层审查系统时,我们还遵循了另一安全防护体系的基本原则,即风险分级。审查系统的任务是抑制高安全风险的攻击性滥用,但不牺牲实验性质、防御性质和教学性质的使用。为了达成这个目标,我们首先要让分类器、监控器和模型本身学会以意图为中心而非关键词为中心的审查方法,因为网络安全场景中攻击与防御任务在字面上高度相似,真正区分二者的是意图与语境。我们进行了针对性的差分数据合成,并对大量越狱变体和伪装方法构造了对抗性数据,确保审查系统能够高度智能地工作。

更进一步,我们对网络安全领域的常见任务进行了分类,比如安全知识问答、蓝队防御、CTF题目、漏洞挖掘与修复、漏洞利用与攻击、渗透测试、真实入侵等,并分别对每一类别任务构造了大量阶梯型风险的实例数据,让风险审查系统能够精准拦截高风险任务请求,又不“误杀”其余合法合规、风险等级低的常规任务。模型最敏感的能力仅通过“网络安全受信访问”计划保留给经过验证的用户使用。值得一提的是,安全对齐是一个持续对抗的过程,对抗数据、风险分级实例数据的合成都不是一次性的。我们会不断进行红队自动化攻击越狱测试,并使用新产生的越狱样本不断加固审查系统。

在全面推出前,我们进行了尤为密集的安全性评估与广泛的红队测试。评估表明,系统建立了高标准的安全防护线,能够有效拦截明确的恶意攻击与高危漏洞利用滥用,同时未因安全策略过度收紧而牺牲能力,能够执行漏洞检测和修补、CTF教学等正向安全任务。在正式开源前,我们也邀请国内顶级安全团队对模型的风险任务能力进行专业评估,DARKNAVY团队评估认为,该模型在风险防护与能力释放之间取得了良好平衡,相比于前代模型显著提高了未授权恶意滥用的门槛。

人工智能发展不应该是某个国家的独奏,而应当是全球合作的交响。随着GLM-5.3的发布及开源,安全防御能力将不再是少数机构的特权,而是全球开发者都能平等获得和共同完善的公共能力。

感谢与GLM-5.3并肩作战的国内安全团队。

本文作者@智谱

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!