顶模 Fable 5.1发布,到底强了多少?

0 评论 279 浏览 0 收藏 12 分钟

顶模天花板又被拉高。Fable 5.1 长任务能力进步明显,缓存读取价从 1 美元降到 0.25 美元,变相降本 25–45%。最亮眼的是它已能一键生成可玩 4A 游戏原型,长时程编码跨过门槛。

昨晚,大模型的天花板又被 Anthropic 拉高了,这次是新发布的Fable 5.1 和Mythos 5.1。

两款模型底层完全一样,区别只在安全限制的大小:Fable 5.1 面向普通用户和企业,Mythos 5.1 则留给经过审核的网络安全和生命科学机构。也就说,大众能用到的顶模就是Fable 5.1 。

模型规格上,这代也沿用 Fable 5的参数。100 万 Token 上下文、128K 最大输出,性能提升也几乎全押在长任务上。

其中,Terminal-Bench-Science从24.7%直接翻到52.6%,AutomationBench 从 17.1% 涨到 31.4%。

使用成本看似没变,输入每百万 Token 10 美元、输出 50 美元的价格也没变。真正亮点是降了缓存读取价,从 1 美元砍到 0.25 美元,真正实用等于减少了25-45%之间成本。

但要注意的是,8 月 2 号之后发布的模型输出都带隐形水印, 而且自带反蒸馏,推理过程做了处理,这是防止大家对它“深度学习”。

由于Claude使用政策,对于大多数用户来说,主要看点可能是这款模型到底进化了多少。

01 任务完成度令人吃惊

这次Claude 更新,最令人惊艳的地方在于,很多玩家用Fable 5.1直接生成了很多大制作游戏,甚至 类似4A 游戏。

最火的游戏案例,是海外网友@rileybrown使用Claude Fable 5.1 AI模型“一键生成”的《使命召唤》游戏,游戏采用Three.js构建,支持程序化资产生成。

可惜的是,不是 Claude 操作Unity这种游戏引擎,而是使用的Blacksite ,这种浏览器里跑的 Web 游戏,技术栈是 Three.js + TypeScript + Vite + Rapier 物理引擎。

尽管细看建模还有点方正,但是物理空间展示和枪击效果都做到了可玩级别。

作者也承认 “ONE SHOTTED”模式, 更接近用 Claude Fable 5.1 的智能体工作流,一次性把项目骨架写出来,实际上提示词其实还没写完,子智能体(sub-agents)和循环还没跑完,Token额度就先打满了。

生成这种伪4A 游戏还是很费Token,但也算AI在游戏开发领域的重大跃进,证明Fable 5.1 擅长长时程编码任务,能从单一提示快速生成完整可玩原型。

Vibe Coding发源机构Bridge Mind,则做了一款马里奥赛车游戏,效果非常出色,在一次性演示中达到了 XBox 街机游戏的水平。

视频中能看到,多辆赛车在跑道上你追我赶,氮气加速和碰撞效果都有,整体还是非常可观。

也有网友提出,要增加适当的检查点、激励物品碰撞等。只是目前AI直接做QQ飞车还有不少距离,Fable 5.1相当于已经有苗头了。

在 LLM 生成视频的案例,一位网友用Fable 5.1+Blender 无头模式,通过对一张图片渲染,制作成了一个电脑般的漫游视频。

最近Blender替代Three.js生成物理视频很火,有网友反馈,前几天他用 Fable 5和 Blender,还很难做出相似的视频,现在Fable 5.1已经可以完成这项工作了。

当然,最明显进步领域,是Claude Fable 5.1做SVG,超越了其他所有模型

用Fable 5.1做SVG确实有些大材小用,但从案例看,这个SVG非常流畅,是少数几个成功掌握自行车传动系统及基本机制的模型案例。

更有网友做了鹈鹕在月球骑车的场面,这就不是SVG技术,估计是完整的定制分布式物理仿真 + 光线追踪技术栈,有感兴趣的网友可以尝试。

02 对比同类模型进化也不少

以上案例中,Fable 5.1有多强已经可以看到,但是进步到底有多少,则在这些案例中可以看到。

在这个游戏生成案例中,Fable 5.1分别在粘性球收集、卡皮巴拉冲浪和饺子传送带躲避三个游戏中,得分10.0/10并获“惊喜升级”的顶级评价,明显优于Fable 5的8.0/10。

不论成绩看质感,也可以看到Fable 5 做的游戏,像素感还是比较明显,游戏运行也比较卡帧,穿模现象明显。Fable 5.1已经像是利用游戏引擎,做出的精美游戏的样子了。

不少网友还用Fable 5.1做一次世界大战,这种高复杂的人物场景游戏也能实现。

对比自家的Fable 5 进步很多,再加上同级别的GPT 5.6对比看,Fable 5.1也有一点优势。

网友@maxt3chno用如下提示词,做了仿古建筑测评:

将一张参考图像转化为一个大型、互动的体素场景,描绘一个日本寺庙建筑群。

Claude Fable 5.1构建了最高大、最具建筑感的版本,中心有一个巨大的宝塔,以及一个元素丰富,看起来更繁华的寺庙区 ;

Opus 5和Fable 5.1建筑布局类似,但是塔的细节不够多,花草树木以及飞雪动效都没有。

Sol 创造了最细致的环境:67,097 个体素,多个寺庙、桥梁、水池、瀑布、樱花,以及氛围浓郁的夜间照明 ,就是看起来比较朴素。

总的来说,Fable 5.1 还是更擅长完善提示词,交出更好的成果。

再将视角转移到和国产模型对比上,Fable 5.1相比上一代国产模型看,差距倒也不是想象中那么大。

网友@Bhavani_00007用最高推理级别,测试了Fable 5.1和kimi 3两个模型,做火箭发射的场景。

从视频中可以看出,Fable 5.1的塔已经完工,kimi 3好像还遗留了点工程;Fable 5.1有更好的阴影,周围景观更多的细节。火箭的引擎烟雾更好,云彩和天空也看起来更好。

Kimi 3 发射时则把梯子也带上去了,出现了逻辑Bug。但是Fable 5.1也不能说完美,火箭发射升空后还在假装抖动,照这个抖法,估计一会火箭要爆炸了。

03 是否具有性价比

一直以来,Claude都是贵的代名词,尤其Fable 单开族谱渐成新高端,Sonnet系列模型不更新,现在以前的高端Opus系列,都快成Claude的低端了,可谓是行业中最贵的低端。

这次Fable 5.1降了缓存命中价格,我们再通过任务完成度等维度对比,看看Fable 5.1最终性价比怎么样。

这其中有很多案例可以看出门道,国外网友@aimlapi 做了一组独立的three.js 测试,视频中共涉及到5个场景。

一个连续项目——一座位于私人岛屿上的未来主义豪宅。外部轨道、带有水晶吊灯的宏伟大厅、带水上乐园的泳池、停放 10 辆兰博基尼的车库、直升机降落在屋顶。

他评价道,Fable 追求真实感,波浪、深度、岛屿周围的沙环都很逼真美观。

而GPT Sol 则采用低多边形风格,优势是风格在所有 5 个场景中从未中断 。

劣势对比也很明显,Fable 的吊灯由数千个独立水晶组成。Sol 的大厅只是一个楼梯和一堵墙 , Fable 的直升机平稳降落在点亮的停机坪,比 Sol 的要顺畅得多 。

从最终成本看: Claude Fable 5.1花费了 $5.69 ,而GPT-5.6 Sol 只花费了$0.88。

他评价道,6 倍的价格换来 6 倍的细节——以及相同的单次生成错误。换你你会选择哪个?

相比国产模型来说,Fable-5.1 从性价比角度看,没有多大的优势。

网友@adxtyahq尝试用 Fable-5.1 和 Kimi K3 重现完全相同的游戏。

在这款类似魂斗罗的游戏中,Fable-5.1 在 UI 和游戏玩法上超越了 Kimi K3。

机制更流畅,交互更好,整体明显更精致。不过, Kimi 仍然很有竞争力,尤其是在游戏过程中抖动更少。

从成本看:Kimi K3 约 11 美元 , Fable-5.1约 18 美元。 Fable 的成本大约高出 60%,Kimi 3生成的质量也大概是Fable-5.1的60%。这么看很多场景还可以用。

最重要的是生成速度,@LLMJunky做了一个3D踢球的游戏任务,过去Fable 5,需要一个多小时才能完成的工作,新版本仅需约 20 分钟。

而且Fable-5.1非常擅长审查,基本上自己发现了许多、许多 bug,到它最终提交时,生成过程中 98% 的 bug 都消失了。

所以这位网友认为,Fable-5.1肯定会在 CAD 领域大放异彩。

而在上文那个火箭模型对比中,Fable-5.1 完成此测试花了 18 分钟,成本 12.60 美元 ,而用 Kimi K3 花了 10 分钟,成本约 6.95 美元。Kimi的生成速度更快,Fable-5.1其实也挺快了。

综合来看Fable-5.1在能力、价格和速度3方面都有所进步,应该能成为一代使用范围挺广的模型。

本文由人人都是产品经理作者【鲸选AI】,微信公众号:【鲸选AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!