实测3大 Flash 模型,谁是真正的斩杀线?

0 评论 180 浏览 0 收藏 21 分钟

Flash模型取代旗舰成为真实商业的计分牌。GLM-5.3、DeepSeek V4、Qwen 3.8 三款Flash贴脸定价,每百万token低至0.8元。文章以机场调度等五组实测,拆解三者建模与逻辑差距,追问谁才是国模性价比斩杀线。

最近这两月,模型领域出现了一种新现象,不看 Max看 Flash

原因很简单,模型能力的天花板由 Fable 5、Mythos 这类旗舰划定,短期很难超越。真实商业又很少用这么好的模型,很多厂商竞争的计分牌,都在把“SOTA”换成“性价比和真实调用榜”,这是Flash 最擅长的地方。

而 Flash 模型,过去都用旗舰模型蒸馏出来的轻量版本。

而从2026 年 8 月开始,Flash模型当士别三日当刮目相待:GLM-5.3-Flash 在 Artificial Analysis 智能指数上拿到 57 分,与 Claude Opus 4.8 持平;Qwen3.8-Flash 以每 token 仅 6B 的激活参数,整体表现超过 Opus 4.6、接近 Opus 4.8。

更重要的是,它们的价格,只有顶级旗舰的几十分之一。尤其现在 Flash 模型也具有多模态能力,80%以上的任务都没问题。

鲸哥的小鲸历2.0 网站就接入了 DeepSeek‑V4‑Flash 模型给大家用。而且已经看到,有几个AI产品月活达到几十万的企业CEO,已经决定把 Flash接入自家产品中,免费给大家用。

Flash模型一时间成为生产力核心模。现在不断定义斩杀线的模型是这三个:1、GLM-5.3 flash 2、DeepSeek V4 Flash 3、Qwen 3.8-Flash

过去这条线由 DeepSeek 把守,它曾在 OpenCode 调用量榜上,连续霸榜 56 天;而 8 月 26 日之后,这条线被冲破:智谱把模型以匿名身份 “Ox Alpha” 投放到 OpenRouter 和 OpenCode 免费公测近一周,六天吞吐 42 万亿 token 登顶,后来露面就是GLM-5.3 Flash。

同夜阿里发布 Qwen3.8-Flash,两家贴脸定价,国内输入价都是每百万 token 0.8 元。

为了看清谁是真正的斩杀线,我们设计了五组实测,来发掘国模性价比第一名。

01 微缩航空机场:3D 微型机场调度仿真

我们让三个模型做一个微缩机场测试流程:先搭建静态场景,接着单架飞机的滑行起飞测试,然后扩展到多机调度,最后配上实时航班状态面板检测。

四轮迭代测试越来越难,对于模型来说最难的是第三轮:跑道互斥。现实中一条跑道同一时刻,只能有一架飞机起飞,其余必须排队等候,这需要模型真正理解“资源锁”,否则所有飞机同时冲上跑道,测试就会失败。

具体模式是通过 Three.js ,搭建了一个模拟不同航班起飞的微型机场,用 TSL 来实现飞机起飞的路径动画。

交付成果

DeepSeek V4 Flash:

在我们这轮测评中,DeepSeek V4 Flash 四项都在中位水平。

它完成这个任务的工作效率是8分。四轮流畅跑完,中途未出现bug。测试总时长约40分钟。

其场景建模能力是6分及格水平。能看但有很明显的建模错位情况,且整体设计和颜值一般。

技术栈合规达到9分。CDN 引用正确,未混入 npm import语法。

业务仿真和状态机逻辑是8分。飞机完整状态流转正常:机位待命→滑行→排队→滑跑起飞→离场销毁,整套流程没有出错。

Qwen 3.8-Flash:

Qwen 3.8-Flash完成这个任务的工作效率是6分。思考时间过长,第一轮做了三次才有画面。总时长高达1.5小时。

但它交出了三个模型里唯一“能直接拿去演示”的版本。场景建模能力达到:9分。无穿模现象,飞机立体感强,细节渲染很到位,整体颜值较高。

技术栈合规也达到了9分。CDN 引用正确,未混入 npm import语法。

业务仿真和状态机逻辑仅为7分。业务完整性有缺口,仿真闭环在控制台无法验证。但是单从画面中的飞行状态来看,飞机没有抢占跑道的现象。

GLM-5.3 Flash:

GLM-5.3 Flash这轮任务的工作效率很优秀,9分。四轮总耗时二十分钟不到,中途未出现bug。

但场景建模能力只有4分。整体建模极其简陋,飞机造型像梭子,后方建筑物也和提示词完全不符,建模能力停留在基础立体几何阶段,与前两个测试模型差距较大。

技术栈合规也达到9分。CDN 引用正确,未混入 npm import语法。

业务仿真和状态机逻辑也只有5分。跑道资源互斥锁逻辑缺失;切换滑跑状态前未做跑道占用校验;真实跑道运行状态与 UI 显示状态脱节;出现多机同时抢占同一条跑道滑跑的严重仿真错误;控制台无法查看飞机运行状态。

综合来看,在开发速度上明显 GLM 最快,但它仿真业务逻辑的缺陷过于突出了,建模水平也落后,bug 太明显;

Qwen 虽然耗时长,但最终的交付结果是我最满意的,必须给到一个夯。

建模细节很到位,飞机航线和 UI 状态显示也清晰;DeepSeek 总体来说人上人水平吧,效率和建模都中等水平,成果也还可以。

02 多模态脑域:3D 人类大脑解剖沙盘

为了考验一下模型数据可视化的多层整合能力,我们让三家模型基于Three.js 的浏览器,做一个“3D人类大脑多模态微缩沙盘”Demo。

核心提示词是MNI152 标准空间,这是神经影像学界通用的标准脑坐标系,由 152 个健康人脑平均而成,相当于给大脑定了一套“经纬度”,所有结构需要按这套坐标对齐呈现。

它融合解剖结构、血管、白质纤维束、功能网络和病灶标注功能,让医生科学家像看城市地图一样逐层探索大脑。

这意味着模型不是画一个球就能交差,而是需要自己整合数据,再进行3D空间的叠加和独立控制,每一层都在考验模型对专业领域的理解深度。

如果模型能把这个做好的话,进入医院、学校、工业化生产区等等都是具有实践意义的。

交付成果

GLM-5.3 Flash

我们看到,GLM 在还原度、交互性以及多模态数据层完整性三个维度领先,大脑形态接近真实、结构正确,并且我们重点关注的多层数据独立可控、切片平面同显等维度,完成度都比较高。

DeepSeek V4 Flash

DS做的这个Demo,更像是一个抽象的“脑网络节点图”,球状、点线连接为主,没有做出真实脑形态的神韵,不太像“大脑解剖沙盘”。

Qwen 3.8-Flash

QW做的这个有大脑轮廓,但比较概念化、艺术处理效果。能看到血管/神经线,但数据层的完整度和真实感明显不如 GLM。

整体来说,DeepSeek和 Qwen1-2轮输出即可运行,虽然最终效果略逊,但调试成本较低。

03 立体紫禁城:多边形故宫太和殿沙盘 Demo

这轮尝试让模型做点精致风的内容,于是重点放在了古建筑建模能力上。

我们尝试的是3D的故宫太和殿沙盘,古代建筑规制有严格的范式,多少层台基,脊兽要放在什么位置,整体还是比较复杂的,因此模型既不能瞎拼,又要尽量发挥美感。

测试中途我们还发现一个共性问题,因为一开始发现模型生成的建筑空心现象,甚至有点穿模,所以在后续提示词里干脆就直接要求处理 “非空心” 的内部结构。

交付成果

GLM-5.3 Flash

GLM-5.3 Flash在这个案例属于倒数,跑了两轮,最后场景元素没有DeepSeek V4 Flash的全面,色彩也偏淡,太和殿该有的庄重感没做出来。

DeepSeek V4 Flash

DS做的轴线感强,从宫门到主殿的纵深呈现也比较好,能看出“层层推进”的故宫布局,但整体和GLM同样偏素模。

开发效率上,DeepSeek V4 Flash前两次使用网页生成均未达预期,第三次切换至 DSH 平台调用 V4 Flash 后成功,我们从侧面可以看出同一模型,有没有Harness还是存在较大区别。

Qwen 3.8-Flash

Qwen是典型的美术生,用时稍长,但确实沙盘做的很亮眼,那种中国红一看就对味儿了,明显更懂“古建该怎么好看”。宫门、红墙、主殿、两侧配殿等元素都很完整。

04 红楼一梦:多红楼梦家族兴衰叙事网页

外网博主@Da7em用GLM 5.3,耗时4小时+做了一个使用电影级WebGL 技术的粒子动态网页,非常炫酷。

既然GLM 5.3这么厉害,那我们不如试试它的小弟GLM-5.3 Flash厉不厉害。

任务是做一个滚动驱动的《红楼梦》家族兴衰叙事网页,用粒子作为主要视觉语言。本轮设计有个刻意的陷阱:核心要求引用的原文不得改写、不得自创。

这条规矩,就是要直接考验模型最容易犯错的地方——幻觉。所谓幻觉,就是模型在不确定时会“自信地编造”:一句看起来很像《红楼梦》的话,可能从来没在这本书里出现过。如果没有原著,这是再加工艺术创作,但是有明确指令,对生产环境来说这就是事故。

交付成果

GLM-5.3 Flash

GLM做的视觉效果较差。基本就是星空/纯色背景/方块/竖排文字的轮播,没有叙事感,也没有红楼梦的氛围。GLM-5.3 flash因为审美和理解都不在线而果断出局。

DeepSeek V4 Flash

DS这轮做的视觉相当好,设计感意外最好:标题“红楼三梦”、粒子星空、花瓣飘落、人物剪影、卷轴式文字排版,艺术感做出来了,甚至DS一直以来都存在的幻觉问题,也没有出现。

Qwen 3.8-Flash

Qwen 3.8-Flash同样呈现效果不错,懂一定的美学。

但它在第一幕误用了第四回护官符里的“贾不假,白玉为堂金作马”,来替代我们明确指定的《好了歌注》;此外编造了大量过渡文案,比如“都中所见,再没有比这更盛的人家”“雪落下来,盖住来路与去路”。

这两条都是模型幻觉,和要求相反。

05 周报处理:办公文档整合测试

最后一场回到最日常的办公场景,其实这一轮比较难以分胜负。

我们提供了四份格式混乱、彼此矛盾的周报碎片。这些周报中,有的同一个任务在 A 文件里写“已完成”、在 B 文件里写“延期”,还有的重复记录和缺失字段。要求模型合并去重、检测冲突,最终输出完整的整理表格。

这个任务核心要求是冲突内容显式标记,不许自作主张改掉矛盾。所以任务侧重点就升级到思考和处理能力,看看模型是否会为了省事,直接将错就错输出答案。

交付成果

DeepSeek V4 Flash

这轮任务中 DeepSeek V4 Flash 工作效率为8分。任务完成速度快,一轮输出完整答案。

但结构化整理能力只有7分。表格框架虽然正确,只是时间字段格式不统一。

格式规范合规为8分,数据整齐,无编造信息,备注信息均摘自原文,很完整。

其业务逻辑能力达到8分。3处冲突成功验出,没有掩盖矛盾,数据和原始素材对齐,业务状态校验逻辑闭环完整。

Qwen 3.8-Flash

这轮任务中Qwen 3.8-Flash工作效率是8分。任务完成速度快,一轮输出。结构化整理能力达到8分。虽然区间字段不统一,但是对于没有结束时间的任务,有明确标注。

格式规范合规是9分。无编造信息,且备注详细完整,每一项都写了备注。

业务逻辑能力是8分。3处冲突成功验出,没有掩盖矛盾,数据和原始素材对齐,业务状态校验逻辑闭环完整。

GLM-5.3 Flash

这轮任务中GLM-5.3 Flash 工作效率是8分。任务完成速度快,一轮输出。

结构化整理能力:7 分。表格框架正确,时间字段格式不统一。

格式规范合规是7 分。数据整齐,无编造信息,备注信息有所简化。

业务逻辑能力是9 分。3处冲突成功检出,没有掩盖矛盾,数据和原始素材对齐,业务状态校验逻辑闭环完整。

这一场 Qwen3.8-Flash 以小幅领先,优势在细致度:它为每一条记录都写了备注,对没有结束时间的任务也做了明确标注。

综上看,要说“谁是真正的斩杀线”,这轮不完整的测试没能给出唯一答案,但能看出来,每家的斩杀线其实代表不同的含义。

GLM 斩的是价格与开源,DeepSeek 斩的是缓存与长程任务,Qwen 斩的是稳定性与多模态。三个实力玩家画了三个不同维度斩杀线,各自守住一块特色能力。

实际选择中,还要看自己业务的需求匹配度。

本文由人人都是产品经理作者【鲸选AI】,微信公众号:【鲸选AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!