Qwen3.8-Max,为何我测完看到的是差距?

0 评论 62 浏览 0 收藏 16 分钟

Qwen3.8-Max-Preview 的 Web Coding 能力实测:从八仙小游戏到鹈鹕骑自行车,它快速生成页面却难抓需求核心。普通模式无法直接预览,Agent 模式才完整。工程包装比主体更精致,理解力仍待提升。

看完动画电影《八仙》,我顺手用刚发布不久的 Qwen3.8-Max-Preview 跑了三个 Vibe Coding 小测试。从八仙小游戏到经典的“鹈鹕骑自行车”, 怎么说呢,完全没有惊喜啊。

第一个版本能跑,但没抓住电影

昨天带孩子去看了动画电影《八仙》,整体确实不错,个人感觉比《功夫女足》更好看。。。

刚好 Qwen3.8 前两天发布,我就临时起意,拿这部电影做个简单测试:不测榜单,也不跑复杂工程,就看它能不能把一句比较模糊的想法,直接做成可以玩的网页。

我给出的第一条需求很短:“帮我根据电影《八仙》,做一个人物介绍的认知小游戏。”

向 Qwen3.8-Max-Preview 提交八仙人物认知小游戏需求

进入任务后,它先做规划,把任务拆成了解角色设定、选择开发工具、检查人物关系和生成 HTML。

好吧,这个任务规划倒也合理,它也知道我想要的是一个最后能够打开、能够玩的网页,单纯写一段人物介绍肯定不够。

Qwen3.8 对人物认知小游戏进行任务规划

随后,Agent 工作室把执行过程拆成四步:获取八仙人物信息和图片、整理结构化人物数据、做信息一致性校验,最后生成认知小游戏 HTML。

Agent 工作室给出的四步执行流程

第一步是搜索人物资料。

它同时检索铁拐李、汉钟离、张果老、蓝采和、何仙姑、吕洞宾等角色,也在工作室右侧持续展示搜索结果。我觉得这一步做得还可以,它没有直接凭记忆开写,而是先去补人物资料。

Qwen3.8 并行搜索八仙人物资料

这段 GIF 记录了它搜索资料、生成“八仙人物信息收集任务”文档的过程。

Qwen3.8 搜索并整理八仙人物资料的过程

资料收集完成后,它继续生成结构化数据,把人物名称、描述、法器、形象特征和图片路径写入文件。这个过程已经有一点小型 Coding Agent 的样子:先收集,再结构化,最后把数据喂给页面。

Qwen3.8 生成八仙人物结构化数据文件

生成网页之前,它还列了一份资源清单,保留每位人物的图片,再规划页面结构和交互。至少从过程来看,它没有上来就吐一大段 HTML,中间还是做了文件整理和检查。

Qwen3.8 生成资源清单与页面规划

接着进入 HTML 生成和文件检查。截图里能看到它引用 Tailwind CSS、Font Awesome 和 Canvas Confetti,并把人物浏览、答题反馈、拖拽匹配等交互写进一个单页文件。

Qwen3.8 检查八仙人物认知小游戏 HTML 文件

大约 7 分钟后,第一版出来了。页面采用传统国风配色,入口分成“浏览人物”和“开始挑战”,里面有八仙人物卡片、知识问答和拖拽匹配。任务总结里显示,规划耗时 28 秒,调用工具/API 18 次。

第一版八仙人物认知小游戏完成并进入预览

完整跑一遍,基础交互基本能用:人物卡片可以浏览,答题后会显示结果,拖拽匹配也做出来了。

但这一版的问题也很直接:它做的是一个通用“八仙人物科普网页”,并没有真正抓住电影《八仙》的角色关系、人物气质和叙事元素。

拿来给小朋友认一认八仙人物,没什么问题。可我一开始说的是“根据电影《八仙》来做”,这一层它是完全没理解一点啊。

代码生成了,Html 却没存

所以我继续追了一句:“你做这个太简单了,而且你没有参考电影《八仙》中的元素。”

它随后补了一套更贴近电影叙事的游戏设定,把内容改成“人物认知大挑战”,还生成了关卡、人物设定和情境推理。

至于里面补出来的电影信息和数据,我当时没有一条条去核。这个小测试我更关心的,还是它能不能把这些想法真正做进前端交互里。

要求 Qwen3.8 增加电影元素和更复杂的玩法

这段 GIF 是它输出第二版游戏方案的过程。从人物配对、台词判断到情境推理,方案明显比第一版更完整。

Qwen3.8 展开第二版人物认知挑战方案

问题也从这里开始,这是我踩的一个坑。。

我当时没有选 Agent 任务模式,只是在普通对话里让它继续优化。代码倒是完整生成了,但它只告诉我把代码保存成baxian_game.html,再用浏览器打开。

普通模式只生成代码并要求用户手动保存 HTML

后面的操作说明也很明确:复制代码,新建文本文件,另存为baxian.html,最后双击打开。

Qwen3.8 给出的手动保存和打开 HTML 步骤

我直接问它:“你不能直接帮我打开吗?”它的回答是,自己没有浏览器、没有屏幕,无法渲染画面,只能让我手动复制和保存。

普通模式说明无法直接打开和预览网页

我觉得这个问题挺影响体验的。

以前试国内其他 Agent 产品时,我也遇到过类似情况:HTML 已经生成了,却不能顺手保存、打开和预览,还得自己复制一遍。代码写完了,事情其实只做了一半。

后来我重新发起任务,这次明确切到 Agent 任务模式。界面进入“执行中”以后,它才开始处理 HTML 的保存和预览。

切换到 Agent 任务模式后重新执行 HTML 保存任务

这次它终于把“八仙·瞒天过海”互动冒险保存了下来。画面也不再是第一版的传统人物卡片,而是换成了深色赛博界面。

你可以从吕洞宾、钟离权、何仙姑、铁拐李中选择角色,再依次进入蓬莱集市、南天门安检和炼丹房,选择不同,“瞒天值”也会跟着变化。

不过,页面能打开,还不等于一次就跑通。第一个保存下来的版本里,我点击角色没有任何反应。画面还停在“未选择角色”,右上角的瞒天值倒是已经到了 10/10。

这段 GIF 记录得很清楚,这是bug 啊。。

第二版首次预览时点击角色没有反应

我只能继续让它修。

修完以后,角色可以正常选择,也能掷骰子、进入下一关,任务卡片会跟着操作切换。左侧的任务结果显示,这次生成了 2999 字,规划耗时 22 秒。

修复后的八仙瞒天过海游戏可正常选择角色

这是第二版从选角到连续闯关的完整演示。

第二版八仙瞒天过海游戏完整演示

鹈鹕骑上自行车,我却看不到自行车

最后我又补了一个更标准化的小测试,提示词只有一句:

create code for an svg of a pelican riding a bicycle as nicely as you can

“鹈鹕骑自行车”是大家测试模型前端生成和 SVG 表达时经常用的一类题目。提示词很短,几乎没给额外约束,但模型既要画清楚鹈鹕和自行车的关系,还要处理车轮、腿部和身体动作。

做得好不好,基本一眼就能看出来。

这次 Qwen3.8 很快就把页面做出来了,而且还顺手加了一块动画控制面板。速度可以切换慢速、正常和快速,也能统一播放、暂停、停止,车轮、腿部、身体和云朵还可以单独控制。

Qwen3.8 根据英文提示词生成鹈鹕骑自行车 SVG 页面

从 GIF 看,速度切换和控制按钮都有响应,天空、云朵、公路和运动部件也都做了动画。

不过把注意力从右边的控制面板移回主体,问题就比较明显了:鹈鹕、腿部和自行车没有很好地组合在一起,有些运动状态甚至很难一眼看出它在“骑自行车”。

Qwen3.8 生成的鹈鹕骑自行车 SVG 动画演示

看到这里,我的感受其实挺明确:它很快搭出了一个功能完整的前端演示,但右边的控制项做得再多,也补不了左边主体没画准的问题。这个 SVG 小任务里,Qwen3.8 的工程包装甚至比鹈鹕本身做得更完整。

三个小任务做下来,我觉得 Qwen3.8 的 Web Coding 还是基本可用的水平。

简单需求交给它,它会自己查资料、整理数据、生成页面,也能把基础交互做出来。第二版的界面、状态反馈和关卡推进,事实上比第一版完整了不少。

但它对需求的理解,有时还是容易停在表面。

第一版听懂了“八仙”和“认知小游戏”,却没接住“根据电影《八仙》来做”。直到我把问题明确指出来,它才开始往电影化叙事和互动关卡上走。

另外一个很关键的点,就是一定要选对 Agent 任务模式。普通模式会把代码贴出来,让你自己保存;

切到 Agent 模式以后,它才能真正生成文件并进入预览。这个入口如果没选对,很容易让人以为是模型不会做,其实是任务根本没进入同一套执行流程。

至于效率和调试,差距还是比较明显。第一版理解得比较泛,第二版先让我手动保存,切到 Agent 模式以后又遇到点击没反应,前后还是折腾了几轮。

在我看来,Qwen3.8 已经有了可用的 Coding 能力,但在理解需求、执行效率、交付闭环和一次跑通率上,和我平时用 GPT-5.6、Claude、Codex 的体验还有距离。

当然,三个小任务还不足以给一个模型下总评,我这里只说这次最直接的感受。咱们真正用 Coding Agent 做事,写完代码只是半程。文件得保存好,页面得顺手打开,出了问题还得继续修,最后交到手里的东西能用,这个任务才算结束。

总之,Qwen3.8 已经能把前半程做得不错,后半程仍然需要继续努力啊。

本文由人人都是产品经理作者【产品大峡谷】,微信公众号:【产品大峡谷】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!