这一次,智谱用GLM-5.3-Flash实现了真正的智能平权。

0 评论 192 浏览 0 收藏 19 分钟

智谱神秘模型OX Alpha终于揭晓,竟是GLM-5.3-Flash!这款原生多模态MoE模型不仅性能逼近Opus 4.8,价格更是低至DeepSeek的一半,引发社区热议。本文深度解析其技术突破、定价策略及国产芯片推理实力,并分享作者用千条数据实测的惊喜结果。

刚刚,在AI行业里,火了整整一周的匿名神秘模型 OX Alpha,终于摘下了面具。

它就是智谱刚刚发布的 GLM-5.3-Flash。

虽然大家已经用各种分词啥的实锤是智谱了,但是看到晚上他们正式官宣的时候,我还是有点想笑。

大家可能不知道,OX Alpha这玩意,在海外到底有多火。

8 月 20 日,OX Alpha突然出现在了OpenRouter和OpenCode上,100万上下文,多模态,完全免费试用,然后就没有任何其他信息了。

接下来几天,它直接冲到了两个平台的第一名。

同时,也让整个AI圈,开始疯狂竞猜这个模型到底是谁家的。

哦对了,这款模型在社区里,还有个中文名。

牛来。

主要是Ox等于牛,然后,也不知道是谁做了这个海报。

于是,牛来这个名字,就开始深入人心了。

无数人在问,牛来到底是谁家的。

有人猜是小米MiMo,有人猜是智谱,有人猜是Grok。

甚至Gemini的都来凑一份热闹。

然后被人也不知道为啥,被人一路狂喷。

当然,也有硬核用户用分词的方式,扒拉出来,这玩意百分百是智谱的。

反正社区就是一顿吵,吵得越狠,热度越高,大家反而更想知道这个牛来是谁家的。

到了今天晚上,谜底终于揭开。

OX Alpha就是GLM-5.3-Flash。

这是一个总参数320B、每次激活18B的MoE 模型,也是GLM-5系列第一个原生多模态模型。

对,原生多模态,智谱的GLM终于也有眼睛了,而且,它支持图像、视频和文本输入,原生上下文100万。

你没看错,视频也支持了。

而且我也不知道他们为啥要给这个模型命名为GLM-5.3-Flash。

因为,这个模型,是一个全新的预训练模型,使用了30万亿Token的多模态预训练数据,根本不是那种把GLM-5.3简单蒸馏以后搞个小的模型。

其实讲道理,我觉得GLM-5.5-flash这种名称,才更适合,也不知道他们为啥取个5.3-Flash。

智谱真是命名鬼才。

跑分上看,在这个体积之下,非常不错。

能力基本逼近Opus 4.8,在Terminal-Bench 2.1 上,它拿到84.3,接近Opus 4.8的85.0;DeepSWE 1.1是63.4;Toolathlon是78.4;Agents’ Last Exam是26.3。

智谱内部的Z.ai Code Bench 里,GLM-5.3-Flash 在最高思考档拿到 29.0,Claude Opus 4.8是29.5。

而在这一段时间的Ox的匿名测试中,社区里的反馈也一致的好评,跟Opus 4.8的这个感觉对得上。

但我知道,你可能会说,这都2062年了,Fable 5.1都要出来了,你咋还对标Opus 4.8啊?

我想说,你不能抛弃价格和成本来看待这个事。

这一次,智谱GLM-5.3-Flash最震撼的,我觉得就是价格。

每百万Token输入0.8元、输出2.8元。

而且还有两周限时优惠,截止到2026年9月9日24:00,直接半价,输入 0.4元,输出1.4元,缓存输入是0.115元。

这个价格是什么概念呢,我们直接对比一下过去一致被称为大模型斩杀线的DeepSeek V4系列。

输入和输出比最便宜的DeepSeek V4 Flash在空闲时段的价格还要便宜一半,不过这块有一说一,Deepseek的缓存黑科技还是有一些东西的。

而能力上,这个GLM-5.3-Flash的能力,还要比DeepSeek V4 Pro还要强一大截。

这就有点太离谱了。

而跟其他同能力等级的模型进行对比。

我觉得这根柱子,就可以看出价格有多低了,而且同时智能水平又非常能打。

今天,GLM-5.3-Flash发了之后,我已经能在很多地方看到这段话了。

牢唐我觉得今天可以荣升唐圣,智谱看来也有自己的滑动变阻器了。

现在,全新的大模型斩杀线的图也正式亮相。

这个斩杀线覆盖的范围,真的越来越大了。

而且还有一个关键点是很多人所忽略的,就是GLM-5.3-Flash除了便宜之外。

过去这一周,他们匿名在OpenRouter和OpenCode上产生这一周的全部推理,是用了10万张国产卡,扛下来的。

他们针对国产芯片显存容量和带宽上的特点,重新优化了整套推理系统。

国产卡,如今这么大规模的实现了推理,抗住了一整周全球用户的免费流量,我觉得这个消息,比所有的东西都更加值得我们振奋。

讲道理,这可能是最近看到的,最让我开心的一个模型了。

而且可能很多老粉都知道,我自己业余时间,运营着一个给大家免费使用的公益网站,叫AIHOT。

现在的月活已经莫名其妙快逼近百万大关了,更别提有多少接我的AIHOT的免费API进行二次开发的了。

那我之所以敢这么给大家免费的用,是因为每个月的运营成本,是我自己扛得住且不肉疼的。

但自从DeepSeek8月17号官宣涨价,梁圣降为牢梁之后,我的AIHOT背后的运营成本,就巨幅上涨,模型层面的支出,每个月直接比翻倍还要多。

这是我AIHOT背后所有用到AI的地方,所用的模型。

几乎绝大多数都是DeepSeek,因为便宜,性价比最高。

我当然知道接Fable 5或者GPT-5.6 Sol之类的效果最好,但是代价就是,我一个月的光给AIHOT上用的API费用,就能烧掉六位数的人民币,未来我想把信源规模继续扩大,那就是继续乘倍数,一个月烧掉百万不是梦。

我除非是脑子被驴踢了我才会用这些最顶级模型来烧,我又不是王思聪。

所以我7月份的时候,还在群里说过。

结果,DeepSeek涨价了,涨到量级大了以后,我现在每天有点扛不住的阶段了,由俭入奢易,由奢入俭难啊。。。

而且,Pro更新以后,世界知识和品味我总觉得怪怪的,导致我自己觉得我整个精选的效果,我自己感觉都变差了。

所以被迫,我开始自建评测集,前几天,人肉标了将近1000条新闻资讯,准备开始全面评估一下现在模型的一些品味和世界知识,找到真正适合AIHOT的且成本我能抗住的模型。

这个评测集,我大概花了一个周末的时间做完了,也做了一下评估。

然后,GLM-5.3-Flash来了,价格比DeepSeek还要低很多,智能水平又高,代码能力大家都有目共睹了,我其实第一时间就想切换了。

但是对我这种任务来说,我要求更高的是世界知识,是对各种资讯的品味,虽然是个全新的预训练模型,但是毕竟才300多B,我很担心这一块能力很差,比不过DeepSeek,导致虽然价格低,但是替代不了。

但是在我花了一点时间,用几个国产的性价比模型跑完了1000条数据回测之后。

结果还挺让我意外的,大家直接看结果吧。

我两个最核心的指标,精选率和挡住垃圾率,就是我自己标了精选的,有多少是AI也精选了的,我明确不精选的,有多少是AI直接拒绝的,中间还有一些我觉得可选可不选的,那些就是中性的给模型的弹性地带。

结果是,GLM-5.3-Flash,在精选率上,直接达到了68.1%,也就是有7成,是跟我自己打标的选的一样,这个数据我还是很惊讶的。

而且我对天发誓,这不是我为了写GLM-5.3-Flash来作弊的,这是真真切切我跑出来的评测,也是真真切切我要解决的AIHOT的痛点的。

而MiMo 2.5 Pro和DeepSeek V4 Pro,都没过50分。

而大家的挡住垃圾率,基本都到了90%左右,差值不过2%,可以无视。

这里我不敢说其他模型的世界知识不够好,我只能说,跟我自己对信息的品味更接近的模型,是GLM-5.3-Flash。

至于K3和Qwen 3.8 Max那些模型我之所以没测的原因,特别简单,因为我用不起。。。。除非我是王思聪,要不然我不敢往AIHOT里面挂。

而在打出的分数上也特别有意思,因为我的精选体系,是让模型给这个新闻打一个0~100分的分值的,这个分值可以简单的理解为,这个信息的重要程度。

然后,正常来说,一般打的分,是符合正态分布的,这样才代表模型的多样性是还不错的。

而这个,是模型给1000条信息打分以后,分值分布。

GLM-5.3-Flash的分值分布是最优雅的,MiMo 2.5 pro次之,出现了2个高峰,而DeepSeek V4 pro的跑分,也解释了为什么更新以后整体的效果变差了,打的分数在两个波段里高度集中,全都在40多分和60多分聚集,多样性严重不足,大家的Prompt和约束全都是一样的,我是真的不知道这个模型出了什么问题。

意外,真的是意外,这两天处理一下工程,后面我要全面的把整个AIHOT背后的模型,全部切换成GLM-5.3-Flash了。

价格低,智能程度高,世界知识也不错,品味好。

我只能用脚投票了。

然后因为这一次,又是智谱的GLM5系列第一个多模态模型,我又随手跑了点前端的案例,只能说,这不像是一个300B的如此便宜的模型能干出来的东西,真的直逼Opus 5了,大家看案例吧。

比如说这个,这个是我希望用代码来模拟一个很古老的工艺,叫做螺钿工艺,就是把贝壳或者海螺嵌在瓷器上,光扫过去很有质感,那我就就希望用这种工艺,来做一个小小的数字艺术的实验网站,能用这种风格,承载几幕小故事。

我就给了几句Prompt,然后又对话了一轮稍微修改了一下故事和文案,GLM-5.3-Flash出来的效果是这样的。

所有的光影、破碎合并的动画、螺钿工艺的效果,都是它自己发挥的,还有下面的文案。

那个文案,我觉得写的也真的很有意境。

“老翁不语,钓起半江灯火。”

“帆一转,家就近了一寸。”

写的就很棒。

然后,还做了一个墨水线条组成的生物,你的鼠标放到哪里,他就能看向哪里,还可以按空格键打散重组,重新随机生成,直接一次成。

还做了一个以蓝为主题的没有用任何所谓设计skill的网页,这个审美我觉得就很棒。

我觉得,这个前端审美和可用性,已经极其的棒了。

最后,再给大家看一下我这个新号的Pro套餐的Coding Plan的额度消耗吧,从0开始,全部都是GLM-5.3-Flash,12点多开始测的,我截图的时间是凌晨5点15分,今晚的跑测试+高强度的跑Case,最终消耗这么多。

我之前一直说,我们需要这样的模型。

需要这样便宜、日常能用得起的模型。

当最前沿的智能,便宜到可以被稍微浪费一点的时候,它才真正开始成为基础设施。

智谱的这一个模型,我觉得做到了。

以原生多模态之姿,极高的性价比。

我觉得,未来一段时间,可能就是很多人的默认模型了。

我也分享一下自己现在的常用搭配,因为开的会员太多了,用量也比较大,所以只能说是仅供参考而已:

日常的部分开发依然会使用Grok 4.6,速度快+量大管饱。

高难和长程任务依然还是GPT-5.6 Sol,稳如老狗,非常安心。

所有的系统自动化任务、后端任务、还有办公任务,全面切换到GLM-5.3-Flash上,极度的经济实惠。

我唯一担心的,就是智谱的算力储备,即使有国产卡推理加持之下,到底能不能抗住后面汹涌的Token消耗。

还是希望,能有更多的国产算力撑起来这片天空。

国运,昌隆。

作者:数字生命卡兹克 公众号:数字生命卡兹克

本文由 @数字生命卡兹克 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!