顶模 Fable 5.1发布,到底强了多少?
顶模天花板又被拉高。Fable 5.1 长任务能力进步明显,缓存读取价从 1 美元降到 0.25 美元,变相降本 25–45%。最亮眼的是它已能一键生成可玩 4A 游戏原型,长时程编码跨过门槛。

昨晚,大模型的天花板又被 Anthropic 拉高了,这次是新发布的Fable 5.1 和Mythos 5.1。
两款模型底层完全一样,区别只在安全限制的大小:Fable 5.1 面向普通用户和企业,Mythos 5.1 则留给经过审核的网络安全和生命科学机构。也就说,大众能用到的顶模就是Fable 5.1 。
模型规格上,这代也沿用 Fable 5的参数。100 万 Token 上下文、128K 最大输出,性能提升也几乎全押在长任务上。
其中,Terminal-Bench-Science从24.7%直接翻到52.6%,AutomationBench 从 17.1% 涨到 31.4%。
使用成本看似没变,输入每百万 Token 10 美元、输出 50 美元的价格也没变。真正亮点是降了缓存读取价,从 1 美元砍到 0.25 美元,真正实用等于减少了25-45%之间成本。

但要注意的是,8 月 2 号之后发布的模型输出都带隐形水印, 而且自带反蒸馏,推理过程做了处理,这是防止大家对它“深度学习”。
由于Claude使用政策,对于大多数用户来说,主要看点可能是这款模型到底进化了多少。
01 任务完成度令人吃惊
这次Claude 更新,最令人惊艳的地方在于,很多玩家用Fable 5.1直接生成了很多大制作游戏,甚至 类似4A 游戏。
最火的游戏案例,是海外网友@rileybrown使用Claude Fable 5.1 AI模型“一键生成”的《使命召唤》游戏,游戏采用Three.js构建,支持程序化资产生成。
可惜的是,不是 Claude 操作Unity这种游戏引擎,而是使用的Blacksite ,这种浏览器里跑的 Web 游戏,技术栈是 Three.js + TypeScript + Vite + Rapier 物理引擎。
尽管细看建模还有点方正,但是物理空间展示和枪击效果都做到了可玩级别。
作者也承认 “ONE SHOTTED”模式, 更接近用 Claude Fable 5.1 的智能体工作流,一次性把项目骨架写出来,实际上提示词其实还没写完,子智能体(sub-agents)和循环还没跑完,Token额度就先打满了。
生成这种伪4A 游戏还是很费Token,但也算AI在游戏开发领域的重大跃进,证明Fable 5.1 擅长长时程编码任务,能从单一提示快速生成完整可玩原型。
Vibe Coding发源机构Bridge Mind,则做了一款马里奥赛车游戏,效果非常出色,在一次性演示中达到了 XBox 街机游戏的水平。
视频中能看到,多辆赛车在跑道上你追我赶,氮气加速和碰撞效果都有,整体还是非常可观。
也有网友提出,要增加适当的检查点、激励物品碰撞等。只是目前AI直接做QQ飞车还有不少距离,Fable 5.1相当于已经有苗头了。
在 LLM 生成视频的案例,一位网友用Fable 5.1+Blender 无头模式,通过对一张图片渲染,制作成了一个电脑般的漫游视频。
最近Blender替代Three.js生成物理视频很火,有网友反馈,前几天他用 Fable 5和 Blender,还很难做出相似的视频,现在Fable 5.1已经可以完成这项工作了。

当然,最明显进步领域,是Claude Fable 5.1做SVG,超越了其他所有模型。

用Fable 5.1做SVG确实有些大材小用,但从案例看,这个SVG非常流畅,是少数几个成功掌握自行车传动系统及基本机制的模型案例。
更有网友做了鹈鹕在月球骑车的场面,这就不是SVG技术,估计是完整的定制分布式物理仿真 + 光线追踪技术栈,有感兴趣的网友可以尝试。
02 对比同类模型进化也不少
以上案例中,Fable 5.1有多强已经可以看到,但是进步到底有多少,则在这些案例中可以看到。
在这个游戏生成案例中,Fable 5.1分别在粘性球收集、卡皮巴拉冲浪和饺子传送带躲避三个游戏中,得分10.0/10并获“惊喜升级”的顶级评价,明显优于Fable 5的8.0/10。
不论成绩看质感,也可以看到Fable 5 做的游戏,像素感还是比较明显,游戏运行也比较卡帧,穿模现象明显。Fable 5.1已经像是利用游戏引擎,做出的精美游戏的样子了。
不少网友还用Fable 5.1做一次世界大战,这种高复杂的人物场景游戏也能实现。
对比自家的Fable 5 进步很多,再加上同级别的GPT 5.6对比看,Fable 5.1也有一点优势。
网友@maxt3chno用如下提示词,做了仿古建筑测评:
将一张参考图像转化为一个大型、互动的体素场景,描绘一个日本寺庙建筑群。
Claude Fable 5.1构建了最高大、最具建筑感的版本,中心有一个巨大的宝塔,以及一个元素丰富,看起来更繁华的寺庙区 ;
Opus 5和Fable 5.1建筑布局类似,但是塔的细节不够多,花草树木以及飞雪动效都没有。
Sol 创造了最细致的环境:67,097 个体素,多个寺庙、桥梁、水池、瀑布、樱花,以及氛围浓郁的夜间照明 ,就是看起来比较朴素。
总的来说,Fable 5.1 还是更擅长完善提示词,交出更好的成果。
再将视角转移到和国产模型对比上,Fable 5.1相比上一代国产模型看,差距倒也不是想象中那么大。
网友@Bhavani_00007用最高推理级别,测试了Fable 5.1和kimi 3两个模型,做火箭发射的场景。
从视频中可以看出,Fable 5.1的塔已经完工,kimi 3好像还遗留了点工程;Fable 5.1有更好的阴影,周围景观更多的细节。火箭的引擎烟雾更好,云彩和天空也看起来更好。
Kimi 3 发射时则把梯子也带上去了,出现了逻辑Bug。但是Fable 5.1也不能说完美,火箭发射升空后还在假装抖动,照这个抖法,估计一会火箭要爆炸了。
03 是否具有性价比
一直以来,Claude都是贵的代名词,尤其Fable 单开族谱渐成新高端,Sonnet系列模型不更新,现在以前的高端Opus系列,都快成Claude的低端了,可谓是行业中最贵的低端。
这次Fable 5.1降了缓存命中价格,我们再通过任务完成度等维度对比,看看Fable 5.1最终性价比怎么样。
这其中有很多案例可以看出门道,国外网友@aimlapi 做了一组独立的three.js 测试,视频中共涉及到5个场景。
一个连续项目——一座位于私人岛屿上的未来主义豪宅。外部轨道、带有水晶吊灯的宏伟大厅、带水上乐园的泳池、停放 10 辆兰博基尼的车库、直升机降落在屋顶。
他评价道,Fable 追求真实感,波浪、深度、岛屿周围的沙环都很逼真美观。
而GPT Sol 则采用低多边形风格,优势是风格在所有 5 个场景中从未中断 。
劣势对比也很明显,Fable 的吊灯由数千个独立水晶组成。Sol 的大厅只是一个楼梯和一堵墙 , Fable 的直升机平稳降落在点亮的停机坪,比 Sol 的要顺畅得多 。
从最终成本看: Claude Fable 5.1花费了 $5.69 ,而GPT-5.6 Sol 只花费了$0.88。
他评价道,6 倍的价格换来 6 倍的细节——以及相同的单次生成错误。换你你会选择哪个?
相比国产模型来说,Fable-5.1 从性价比角度看,没有多大的优势。
网友@adxtyahq尝试用 Fable-5.1 和 Kimi K3 重现完全相同的游戏。
在这款类似魂斗罗的游戏中,Fable-5.1 在 UI 和游戏玩法上超越了 Kimi K3。
机制更流畅,交互更好,整体明显更精致。不过, Kimi 仍然很有竞争力,尤其是在游戏过程中抖动更少。
从成本看:Kimi K3 约 11 美元 , Fable-5.1约 18 美元。 Fable 的成本大约高出 60%,Kimi 3生成的质量也大概是Fable-5.1的60%。这么看很多场景还可以用。
最重要的是生成速度,@LLMJunky做了一个3D踢球的游戏任务,过去Fable 5,需要一个多小时才能完成的工作,新版本仅需约 20 分钟。
而且Fable-5.1非常擅长审查,基本上自己发现了许多、许多 bug,到它最终提交时,生成过程中 98% 的 bug 都消失了。
所以这位网友认为,Fable-5.1肯定会在 CAD 领域大放异彩。
而在上文那个火箭模型对比中,Fable-5.1 完成此测试花了 18 分钟,成本 12.60 美元 ,而用 Kimi K3 花了 10 分钟,成本约 6.95 美元。Kimi的生成速度更快,Fable-5.1其实也挺快了。
综合来看Fable-5.1在能力、价格和速度3方面都有所进步,应该能成为一代使用范围挺广的模型。
本文由人人都是产品经理作者【鲸选AI】,微信公众号:【鲸选AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益



