实测智谱GLM-5.3-Flash,稳稳把DeepSeek逼进斩杀线

1 评论 389 浏览 0 收藏 14 分钟

GLM 5.3 Flash与Qwen3.8 Flash同日发布,价格战成为焦点:输入0.8元、输出2.8元每百万Token,与DeepSeek的价差没有想象中大。作者把两个模型放进同一环境A/B跑一周看谁更省钱,并实测前端与3D游戏生成能力。

GLM5.3 flash和Qwen3.8 Flash同一天发布了,上周我还猜牛来模型是小米MiMo,不过很快就有人用分词探测器实锤是GLM系的模型了。那来都来了,先来对比一下争议性很大的价格问题,

GLM 5.3 flash现在是每百万Token输入0.8元,输出2.8元,DeepSeek因为分时间段,我就直接拉一个图来对比了。

Image

但5.3本身会通过多尝试增加轮次来提升准确性的,跟DeepSeek基本上往99%打的缓存对比,我只能说价格差没有想象中大。

最简单的方式就是做A/B test,把deepseek v4 flash和GLM 5.3 flash放到同一个环境跑一周看看哪个省钱。

老粉应该知道我在上上周开源了一个AI提示语案例网站goodcase,现在已经录入700个带完整提示语的case了,里面的提示语,case摘要,skill生成都是deepseek v4 flash跑的,堪称劳模。

Image

然后大家可以看看这个图,价格改变了之后差距有多大。我现在都只敢晚上悄摸定时跑了。

Image

所以,我现在就希望定时跑完一周后能选出更低成本的,不然我要hold不住了。

不过GLM 5.3 flash的前端能力倒是现在就可以测出来的。因为这次我看X上5.3 Flash做的3D游戏,UI效果都很离谱,甚至还可以剪辑视频。

Image
Image

所以我就让它帮我给goodcase重新设置了一下主页,希望能展示更多信息。

一到六号,大家觉得更好看的是哪个?我打算把第一个更新到下个版本了。

这两天,我还在HICOOL 2026上给我的Goodcase站台,感兴趣的大家可以来找我玩。

在测其他能力前,我先来放一张总图,

Artificial Analysis发的斩杀线图,它把59个模型的智力分和单次任务成本放在一起比了。

Image

纵轴是能力,横轴是花钱。

GLM-5.3-Flash那个红点在$0.045 / 57分,直接卡在最左边的前沿线上。右边红色那一片,全是花更多钱还拿不到这个分数的模型。DeepSeek V4 Flash在它右上角,贵一倍还低6分。

当然光看一个综合分不够,我们拆开看,

Image

14项benchmark一项一项对,跟DeepSeek-V4对打,结果是赢11项。Coding端几乎打平,Agentic端开始拉开,到了视觉端就是碾压了,六项全赢,最大差距是大概40%。AutomationBench上直接赢了10分,GDPval赢了快100分。

分差打到那么小的同时,这个模型在发布前还匿名叫ox-alpha,也就是牛来,在OpenRouter上跑了一周,直接成了当周最受欢迎的模型,处理的token量是第二名的2.3倍,还全部跑在国产的AI芯片上。。。

Image

来都来了,再来一张AA index榜上国产模型大合照吧,kimi、glm、qwen、deepseek、minimax,堪比人类群星闪耀时

Image

接下来我们再跑一轮实测,coding,agent,视觉各来几个真实任务,看看纸面数据落到实际使用里到底能不能打。

从复刻网站开始。

按照智谱说法是给张图就能复刻网站。每次有官方的Case,我首先就是质疑,然后先把演示视频抽帧,把画面抽出来让模型重新跑,能还原个70%80%就很没有水分了。

我从智谱放出来的case截图丢给zcode上的glm 5.3 flash,让它照着做。提示语就一句,帮我根据这张图复刻这个网页,做个一模一样的出来。

Image

然后本来还想找点水分的被啪啪打脸了。。。

Image

左边栏1比1复刻,底部导航完整弄出来了,配色间距字体感觉都对。

中间也没啥问题,有些糊的细节他也给我完善好了。。

放大缩小,我看到的所有地图功能真的也都给我实现了。。

既然能看图,能看视频也很合理吧,GLM 5.3 flash说是会支持视频输入,能自动切片抽帧。我想着那我也来,丢了个影片截图过去,让它跟着画面做页面,原汤化原食了属于是。

还是一句话,

帮我根据这个视频复刻里面的网站,效果要一模一样,看看怎么做。

也是真的做出来了。。。

从思考过程上看没有在偷懒,自己选了用ffmpeg把视频拆开,一帧一帧抽出来分析,然后照着画面里的元素去还原。连视频里的渲染效果过渡动画它都注意到了,尽量在页面里复现。

Image
Image

大概半个多小时,画面一次给我出了。

不能说1比1全做出来了,毕竟页面和页面之间的交互跳转还不够丝滑。但真的就凭静态页面和其他的视觉效果,1比0.96也要有了真的。

继续继续,要让网站重现的方法除了图生图外,还能直接把链接贴给5.3 flash让他看了做,这次直接拿出了大家的好朋友,GitHub。

提示语还是一句话,帮我完成复刻一下 github 这个网站越细节越好。

20分钟,从0到1直接我的新github来了

Image

来个无奖征答,猜猜这个是复刻出来的还是github正品。。。

复刻完三个网站我想试试从零做东西行不行。

先从2D开始,让他做一个的贾维斯风格界面,钢铁侠那种科幻UI,保持着我们的一句话出页

超写实的JARVIS赛博朋克桌面UI仪表盘,显示器上呈现真正可用的软件界面。

整体采用暗黑与深蓝配色,搭配发光的霓虹青色点缀和玻璃拟态面板。

中央是带有全息光环与粒子效果的AI能量球;

左侧显示系统状态和波形图;

右侧为神经网络聊天面板;

底部设有极简程序坞。

整体呈现电影级HUD视觉效果,精致度极高,16:9 画面比例。

做出来的效果是这样的。

这一排状态面板,加上中间的蓝色能量球带轨道环,以及右边神经网络对话窗口。底部命令输入栏还能做些小交互,该有的元素全有,荧光科幻感,连ARC REACTOR 98.7%,THREAT LVL 0.02这些电影细节都给我补上了还。

我本来以为2D就到这了,然后随口补了一句能不能做成3D可交互的。

不给他限制主题,就是要视觉冲击。

保持这种圆球旋转科技感帮我以这个为想法做一个全新的项目转化为3D项目。

结果不愧是新模型新脑子,就是听话

一出闪瞎了属于是,特效给我彻底堆满了感觉。。。

中间那个球成3D了,可以用鼠标拖拽旋转,轨道环也有了景深和动效,粒子会跟着转。

左边的有了控制输入,右边对话窗口实时输出,直接从一张静态图变成了一个能互动的东西,而且审美没掉线。

Image
Image

最后的最后,还是来玩个大的吧,直接让它复刻一个3D游戏。

选了Krunker,那个浏览器端的像素风 FPS,给了官网链接让它照着做。

Image
Image

这个是跑最久的,前前后后修了一个多小时。但说实话,主要的游戏逻辑一开始就调完了,3D 场景,移动,射击,碰撞检测这些核心的东西,它一遍就出来了。

Image
Image

后面一个小时基本都在修小bug,比如W S键弄反了,往前走变成后退,还有开火的时候偶尔敌人刷新不出来。

除了这些小问题,其他都没什么太大问题。

其他的话,有音效能选biubiubiu,每局进去组队敌人还都不一样。。。

一个浏览器里跑的3D游戏,从给链接到能玩,一个多小时,还不是那种套个模板的半成品。。。。这个完成度我是真的没想到的,直逼opus5和gpt 5.6 sol

全部跑下来,我的感受很明确。

5.3-Flash不是那种跑分好看但实际用起来拉胯的模型,完成度都挺在线的。

那我计划就很简单了,接下来一个月把日常批量跑coding和agent任务分流给GLM-5.3-Flash,又可以狠狠省成本了。

模型这个赛道,今年整体的感觉就是一个比一个卷,价格一个比一个低,能力一个比一个猛。而且很多时候根本没想到会直接开源。

对我们来说选择多了,成本低了,每隔几周就有新东西可以玩。

有点期待被GLM拉到斩杀线的DeepSeek会不会整点新活出来。

本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 斩杀线这张图很直观,但把它当唯一标尺也容易忽略场景。DeepSeek的缓存命中做得更实,批量任务里实际成本未必比GLM高;单项分数赢了11项,落到自己业务里还是要按调用密度算账。

    来自广东 回复