横评GLM-5.3、DeepSeek-v4-pro、K3,谁才是Coding新王?

0 评论 124 浏览 0 收藏 8 分钟

大模型编程能力哪家强?GLM-5.3、DeepSeek-v4-pro、Kimi K3 同题竞技,接官方 API 在 Claude Code 中直面前端网页、3D 场景、网站开发与游戏开发四重考验,从任务完成度与输出质量两个维度给出实测结论。

最近,模型圈又开卷了:江山代有模型出,各领风骚两三天。

DeepSeek-v4-pro正式版、Gork-4.6、Gemini-3.7-flash、GLM-5.3都在这周陆续发布,Benchmark分数一个比一个亮眼,但跑分归跑分,实测表现才是试金石。

于是,我拉来了久经考验的Kimi K3,一起做了这期横评。

参评选手:Kimi K3、GLM-5.3、DeepSeek-v4-pro-0813。统一任务类型、统一提示词、统一评分标准,全部接官方API在Claude Code里跑一遍。

共四个任务,覆盖前端网页、3D场景、网站开发、游戏开发等场景,主要评估模型的Coding能力。

01 一手横评

测评原则依旧是那句话:变量归一,对比才有意义。

三个模型用同一份素材、同一条提示词,全部接官方API在Claude Code里跑,最终从「任务完成度」和「输出质量」两个维度进行综合评价。

1)前端网页

前端任务,重点考察模型的审美水平与交互细节把控。

提示词也是极其简单。

提示词:

创建一个HTML,科普JPG/PNG与SVG的区别,黑色科技风背景,顶级审美,前沿设计。

三个模型同台竞技的结果如下。

整体来看,GLM-5.3和K3明显更胜一筹,无论是页面布局、配色体系还是交互细节,都比v4-pro更耐看。

尤其是他俩设计的「位图 vs 矢量图」对比动画,非常精美,一眼就能看出代码功底。

v4-pro也不能说它丑,审美底子还是有的,但明显是上一代的水平,大概相当于opus 4.6/4.7的水准。

本轮实测:GLM-5.3 ≈ K3 > DeepSeek-v4-pro-0813。

2)3D场景

3D任务,我们来个复杂一点的,让大模型还原「十万天兵天将围攻花果山」这一经典场面。

提示词:

用Three.js做一个“十万天兵围攻花果山”的3D互动场景网页,剧情、视角和场景都要跟《西游记》完美对上。

DeepSeek-v4-pro:

Kimi K3:

GLM-5.:3:

DeepSeek-v4-pro这轮交付的是一个半成品,反复调试多次后,页面依然是黑屏,无法正常渲染。

相比之下,K3和GLM-5.3均为一次直出,且交付质量相当高。尤其是K3,它的四幕剧情设计和多视角预览撑起了整个3D网页的叙事骨架,建模细节也相当到位。

不过K3也有瑕疵,花果山怎么会在海上呢?这一点上,GLM-5.3的水墨天穹显然更尊重原著,国风长卷构图也更契合中国故事的表达。

本轮实测:GLM-5.3 > K3 > DeepSeek-v4-pro-0813。

3)网站开发

网站开发任务,是让三个模型为我开源的标题skill做一个产品官网。

提示词照样是极其简单。

提示词:

给开源skill(详情见lengyi-title文件夹,GitHub地址:https://github.com/woyin2024/lengyi-title)设计一个产品宣传网页,极致的精美,顶级、前沿审美。

DeepSeek-v4-pro:

Kimi K3:

GLM-5.3:

三个产物看下来,你能明显感觉到v4-pro依旧停留在上个时代,而K3和GLM-5.3已经到了Fable级的设计水准。

包括像昨天,我用Doubao-Seed-Evolving给这个Skill做的产品网站,审美也很在线,基本和k3、glm-5.3一个水平。

具体来看,GLM-5.3采用墨色打底 + 朱砂配色 + 衬线字体,走「编辑部 + 数据感」的视觉路线,气质拿捏得很准。唯一的小瑕疵是二维码图片被压缩了,不过这倒不能全怪它,GLM-5.3是纯文本模型(基于 GLM-5.2后训练),本身不具备视觉识别能力。

三者之中,K3的效果最让我满意:暖色纸底 + 衬线大字 + 朱砂红点缀,辅以报纸式分栏线、标本编号、印章贴纸等排版元素,整体观感非常舒服。

尤其是一些小细节上,它做得很到位,比如这个简单的UI动画,一看就很高级。

本轮实测:K3 > GLM-5.3 > DeepSeek-v4-pro-0813。

4)游戏开发

过去,大模型想做复杂的游戏开发,“一句话”指令根本不可能。

自从K3发布之后,这件事开始变得可行了。

我先让K3写了一份剧本。

接着,再将剧本交给三个模型分别开发。

提示词:

根据“源记-游戏.md”剧本,开发一个3D互动的网页游戏。

DeepSeek-v4-pro:

Kimi K3:

GLM-5.:3:

三个模型跑下来,只有K3的版本可以从头玩到通关,GLM-5.3在第二关出现操作失效,v4-pro则在第一关就报错,还莫名跳跳到第二关。

有意思的是,K3还实现了完整的双线叙事:不告发 → 结局一《不复得路》;告发 → 带队 → 结局四《黑色桃花》→ 终章 → 真结局《问津者》,全部分支都能正常触发,无脚本错误。

本轮实测:K3 > GLM-5.3 > DeepSeek-v4-pro-0813。

写在最后

整体测下来,我感觉K3依然能打。

四个任务综合来看,K3的能力最夯,GLM-5.3次之,v4-pro比较拉垮。。

速度方面,v4-pro倒是很快,像最复杂的游戏case,它只花了十来分钟;glm-5.3,花了43分钟;K3更久,花了67分钟。

但速度快,不代表质量靠谱。测下来,我对v4-pro正式版倒是有点意外。我原以为它能跟上国内第一梯队,目前来看,还需努力。

本文由人人都是产品经理作者【沃垠AI】,微信公众号:【沃垠AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!