用了一周后,来深入聊聊GLM-5.3

0 评论 603 浏览 0 收藏 17 分钟

国产模型冲进全球前十的案例又添一个。作者用一周真实体验拆解GLM新旗舰:从安全审查、Skill开发到3D游戏与写作四大场景实测,并解读其以最小参数量跻身头部榜单背后的后训练故事。

最新的AA(Artificial Analysis)榜单出来了,前十里出现了三个国产模型。尤其是,Kimi K3和GLM-5.3直接干到了全球第四、国产第一的位置,仅次于Claude Fable 5、Opus 5、GPT-5.6 Sol和Grok 4.6。

抛开分数,还有一个细节可能很多人都没注意到。在前十模型里,只有GLM-5.3的参数量不是T级,仅744B(激活40B)。

看完榜单和参数,你可能更想关心:它实际用起来,到底行不行?我想结合这几天的真实体感,用四个具体Case跟大家聊聊,以及这个参数体量背后的故事。

01 实测体感与真实case

1)安全审查

我之前开源过一个Markdown编辑器,几乎没做任何安全审查就传到了GitHub。当时没多想,可真要把它部署上线,这里面的坑就大了。

我把代码整个丢给GLM-5.3,它一口气帮我揪出了6个漏洞。

看到它对每个问题的描述,看得我后背发凉。不是那种模棱两可的「可能有风险」,而是精准指出问题出在哪、会被怎么利用。

最后,它顺手给了两条方案:一是把DOMPurify集成和SRI直接写进HTML,二是重写一版加固过的代理脚本,然后反问我一句「要不要做」。这还用问吗,必须做。

建议大家的真实项目,在上线真实环境前,很有必要让GLM-5.3先扫一遍

这不是玩笑,最近黑灰产相当嚣张,已经有不少政企网站中招了。一次疏忽的代价,可能远比你想的大。

GLM-5.3在安全攻防上的实力,也不是我一个人的错觉。在CyberGym这项测试里,模型需要从白盒源代码出发,通过触发程序故障来识别并验证漏洞,GLM-5.3拿到了84.5%,超过了Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

2)Skill开发

Skill开发,我一直觉得是最能考验一个模型Agentic能力的场景。身边不少朋友开发Skill,基本只认Opus 4.8/5、GPT-5.6 Sol这两个。

这次我试着让GLM-5.3上,几轮对话下来,很快就做出了一个专门写GitHub「README.md」的Skill,思路很顺:

第一步,先让它给我推荐一批优秀的GitHub仓库。

第二步,提取这些优秀README的共性特征,沉淀成一份规范。

第三步,照着这份规范,生成一个专写「README.md」的 Skill。

然后我还是拿前面这个Markdown编辑器练手,用这个新Skill重写了一份README。


这是原来的README。

两者改动对照情况。

可以看到,通过Skill写出来的README.md一下子就专业、高级了不止一个档次。

这个Skill我后面再打磨打磨,到时候开源给大家。

3)3D游戏

结合最近爆火的《牛来》,我想了个略抽象的Prompt:

参考“图1.png”的剧情内容和人物主体,结合最近爆火的《牛来》热点,使用Three.js创建一个3D互动游戏。演绎现代版的“牛头不对马嘴”,故事一定要新颖。

这一个提示词,其实同时在考三件事:3D建模能力、一口气写长代码不崩的工程质量,以及创意本身。三关叠在一起,很能看出模型的真功底。

最终效果,有点“牛来”。

整体来看,GLM-5.3的3D生成能力没得说,基本和Kimi K3并驾齐驱,而且都一举将国产模型拉到了世界级的水准。

4)写作能力

写作,是我最近测下来的意外之喜。

我的提示词很简单粗暴:

用豆瓣长评腔评价《牛来》。

《牛来了,电影死了,我们都笑了》

散场的时候,影厅里响起了掌声。不是礼貌性的,是狂欢式的。我坐在第五排,看字幕滚完、保洁阿姨进来赶人,突然意识到:我已经很多年没在电影院听到过掌声了。上一部还是某部制作精良的什么——你看,我连名字都忘了。

先说结论:《牛来》作为电影,零分。作为事件,满分。

一个两人剧组,一头进入梦境的牛,灾难级的建模,梦游般的叙事。如果说塔可夫斯基是凝视水面的长镜头,那《牛来》就是一头牛直接踏进水面,溅你一身。布努埃尔用剃刀割开眼球,宣告超现实主义降临;《牛来》什么都不割——它压根不知道眼球在哪,但它横冲直撞的样子,意外抵达了同一个地方。这不是解构,因为解构需要先懂结构。这是纯粹的无知之勇,是电影诞生之初“老子不管反正就要

拍”的原始冲动——工业用一百年把这种冲动阉割干净,《牛来》又捡了回来,嚼得津津有味。

我知道你要骂我过度阐释,给垃圾镀金。但请注意,我从没说它好。我说的是,它是必要的。

我们看了太多“正确”的电影。算法知道你要哭,第二幕就下刀子;美术知道你要截图,每一帧都留着水印位。精修的完美看多了,人会失明。而《牛来》粗糙到近乎赤诚:它不讨好你,不计算你,甚至不理解你。在一个人人表演“懂观众”的时代,一个彻底不懂观众的东西,反而成了唯一的真实。

所以那些驱车三十公里的观众,买的不是票,是赎罪券,为我们曾用十倍票价供奉无数精致的无聊而赎罪。

美国有《房间》,我们有《牛来》。托米·韦索烧了六百万美元拍出邪典圣物;我们的《牛来》九天票房七千三,被嘲几天后单日反冲三十五万。“烂片拯救票房”这件事,本身就是最超现实的剧情,比片里那场牛梦超现实多了。

评分说明: 五星。一分给牛,一分给梦,一分给两人剧组明知不可为而为之的莽,一分给影院经理紧急加场时脸上的表情,最后一分给所有笑着散场、又在深夜写下“其实我们笑的是自己”的伪君子们——包括我。

牛来了。

它不是来拍电影的,是来给电影收尸的。

结果,葬礼变成了派对。(by glm-5.3)

论文腔。

结果它的笔力是真有把我惊喜到,腔调拿捏得准,行文有水准,完全不是那种稳稳接住的「理工味」。一个主打Coding的模型,文科居然也没落下,这大概又是后训练那套功夫的溢出红利。

02 小小的模型,大大的智能

AA榜单60分以上的模型,一共有6个,其中GLM-5.3是参数量最小的,只有744B(激活40B)。

和它同处头部的,都是些什么来头?

  • Kimi K3:2.8T
  • Grok 4.6:约1.5T
  • Qwen3.5-max:2.4T
  • Claude Opus 5:网传10T级别

排在GLM-5.3身前身后的这些选手,体量普遍是它的2倍,多的甚至10来倍。那智能程度呢?彼此之间就差两三分。

而更有意思的是,它和GLM-5.2是同一个底座,每一分提升都来自后训练。这句话不是我说的,是智谱官方博客的原话(“It uses the same base model as GLM-5.2 — every gain comes from post-training”)。翻译成人话:同一副骨架、同一个天花板,上一代只发挥到53分,这一代直接摸到了60。

也就是说,除了预训练,后训练同样也能拔高模型的智能,这次智谱或许开启了一条新的模型训练之路。这也是为什么智谱创始人唐杰教授说这次GLM-5.3是一场控制变量实验的原因。

什么是前训练、后训练?用句沃垠AI群友的话理解就是:“简单来说,你记住了和你会用了是两个概念。预训练相当于给了你很多知识,让你记住。后训练就是,让你学会把这些知识用起来。

光讲道理不够劲,我把它和最近发布的两个模型放在一起,你就能看到差距了。

第一个,Kimi K3。它同样是60分,和GLM-5.3打平,但体量是2.8T,GLM-5.3只有它的四分之一。同样的分数,四分之一的身板。

第二个,DeepSeek-V4-Pro-0813。AA得分53,比GLM-5.3低7分,总参数量约1.6T,是GLM-5.3的三倍。

值得注意的是,上一代GLM-5.2也是53分。换句话说,GLM只用一代迭代,就在同一把尺子上,把自己和一个三倍体量的对手,拉开了7分的差距。

03 对用户,这意味着什么?

如果说60分是结果,那智谱把劲儿使在了哪儿?答案是:死磕Coding与Agentic能力

官方博客里,GLM-5.3在自家Code Bench相比5.2有约50%的提升,并自称「当前最强的开源权重编程模型」。

甚至还有点「超纲」的意外之喜:智谱提到,在扩大后训练规模的过程中,模型的网络安全(漏洞发现类)能力涌现得比预期还快,在CyberGym这类网络安全基准上做到了开源SOTA。

一个主打编程的模型,把能力外溢到了安全领域,这种「练着练着多长出一身本事」的感觉,恰恰是后训练威力的又一个侧写。

「小小的模型,大大的智能」落到用户侧,带来两个实打实的好处。

其一,推理成本更低、速度更快。参数小,意味着同样的算力能服务更多请求,反映到API价格和响应延迟上就是更便宜、更快。

其二,私有化部署的门槛更低。GLM系列一贯开源权重,744B总参+40B激活的体量,意味着企业在自己机房里拉起一套私有化部署,所需的硬件规格和成本,都比动辄2T、3T的庞然大物要友好很多。

已确认,GLM-5.3的模型权重将会在下周五正式开源,大家可以期待下。

想要体验的,目前Z.ai、智谱清言APP、BigModel开放平台GLM Coding Plan都已经可以体验。API价格和上一代GLM-5.2一致,没有涨价,输入8元/百万tokens(缓存命中2元),输出28元/百万tokens。

写在最后

最后说点主观的。

GLM-5.3这次上线很低调,很容易让人以为不过是一次常规的小版本迭代。但把AA这个榜单摊开来看,你就会意识到它其实是被低估了:一个744B的模型,站在一群T级选手中间,还丝毫不落下风。

放到国产模型当下的格局里看会更清楚——Kimi走「大而全」,DeepSeek主打性价比,而GLM这几代明显在死磕Coding与Agentic能力。GLM-5.3更像是这条路线上的一次集中兑现。

按官方说法,它会在下周五开源。到那时,海外一众provider大概又要为多了这么一个「小体量、高能力」的新选项而振奋一阵子。

从这个角度说,这不只是智谱的一次版本更新,而是又一个足够能打的开源模型,被中国团队交到了全世界手里。

本文由人人都是产品经理作者【沃垠AI】,微信公众号:【沃垠AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!