实测GPT6 Sol和Luna和Claude Opus5.5,我们再不用愁额度少和速度慢了

1 评论 203 浏览 0 收藏 13 分钟

GPT-6 Sol、Luna 与 Claude Opus 5.5 同期可用,作者用鹈鹕骑单车、可交互饺子网页和前端动效三组案例做横评,认为 Opus 5.5 在细节与前端能力上仍领先,而 Luna 更适合信息搜索、文件改名这类批量简单任务。

这这这,如何是好啊。

同时能用上GPT-6 Sol / Luna,还有Claude Opus 5.5,这我MiMo V2.6还没测完呢,jev还没玩够呢,Grok4.7都没玩熟呢,kakaka三个模型丢我脸上,我三头六臂来测啊。

本来还想先用gpt6 sol做张封面图过过瘾先,结果就上了个空壳。不过模型切换都有了,说不定今天或者是明天,随便一个时间就上了。所以我们还是先马不停蹄,来把Opus 5.5测一下吧。

我服了,我写到这又可以用了,那还是并行测吧,来都来了。

先来当价格侠,GPT 6 Sol和Luna的API价格比GPT5.6的价格还降低了50%。也就是说对200刀的Pro用户来说,这两个模型的用量几乎就是随便用,用起来还不心疼,也不需要tibo发额度卡了,天才程序员直接原地回归。

隔壁Anthropic也有招,新模型性能达到了Claude Fable 5.1的水平,生成输出的速度比Opus5快30%,运行成本比Opus5低 40%,我都有种额度用不完的错觉了。还提升了pro,max,team套餐的五小时额度窗口,还还还给了一次重制额度。

不睡了!继续继续。

分数这块我们超光速过一遍,Opus 5.5的最大提升在终端编程,比Fable 5.1都能提10个点。但也不是每项第一,GPT-6 Astra在商业流程和科研Agent这两项分数更高。

搞定,进实测,先一个个模型来鹈鹕骑单车,想到我平时基本上用的都是high,比较简单的任务才会用medium这个推理强度,所以接下来这三个模型都会用 high来进行推理强度的对比。 ㅤ

光这个case我们就可以看出来区别了,最右侧的Opus 5.5骑起来是带风,腿的前进方向也是正确的,手也够到了车把,甚至还可以眨眨眼,整体来说没什么问题。中间的gpt6 Luna轮子方向是反的,手也没有的,整体来说就是呆呆的。最左边的gpt6 sol腿倒是没啥问题,就是手够不上把,看起来像嘉豪。

还有一个经典对比,就是GPT系的UI能不能比过Opus5.5,

这次直接上一个goodcase里可以做出来可互动饺子的网页提示语,还要做一个网页版的录制按钮记录操作片段,真的超级长超级长,大家可以都拿着这个提示语去试试看这些新模型。

这是gpt6 luna做的,那其实从刚刚的鹈鹕测试里面就看出来,Luna建模建得其实不是非常精准。

但在网页的风格设计,交互,以及最后录制的按钮上,都是成功交付的。这样的话我对Luna这个模型版本有了不少的改观。我觉得之后要是做一些文件移动,重命名,信息搜索,一些适合批量的简单Agent任务,交给Luna不心疼积分,也不用担心效果会差。

这是gpt6 sol做的,虽然我不太想承认这个是饺子,但是在夹起粘住的瞬间还会靠近,有种把饺子递到你口中的感觉,以及在点击录制之后会弹出来一个额外的小卡,在整体的交互上会显得更加可爱。

我觉得这回是真的有可能打败Opus5.5,打败Claude系列了。

好吧,我看来我说早了。

还是比不了比不了。

我本来已经做好准备只比gpt好一点的话,也说一句GPT-6有大进步了,但还是好太多了。

不管是饺子数量变化的时候Q 弹的动态,还是夹起饺子时筷子尖刚好夹着饺子皮的细节,还有点饺子的时候,GPT6做出来的醋都有那种水滴突然绽出来的感觉,但claude opus5.5做出来醋是波纹型的!波纹型啊!

更绝的是递到我嘴边咬一口的时候,那个饺子居然对我笑,还会有心心冒出来!我都很难形容我现在的心情,看一个网页,有种莫名其妙嘴角合不拢的感觉。

还有一个我最近用的提示语,不给模型设限也不额外给3D资源和建模啥的,就让模型设计动效,

# 随心所欲提示语

 

为前端开发者打造一个现代、惊艳且富有创意的网站。

网站应包含 3D 模型、视差滚动、Lenis 平滑滚动等效果,并提供流畅的用户界面体验。

使用先进的技术栈编写代码。具体怎么实现由你决定。

我不得不承认,这种高端局把Luna带进来,可能有点为难它了。

它整体给我的感觉,有种越努力越心酸的感觉。配色方面是挺大胆挺不错的,我觉得紫黑青这种三色搭配很好看,但也仅限于好看了,页面模块之间跳转以及点击交互,都没有达到我的预期。

OK,gpt-6 sol的表现要好不少,3D建模和转场的平滑动效这一块还是很丝滑的,不过整体还是静态图表为主,就是完成度挺高的但是动效一般般的感觉。

Opus5.5的前端能力还是强啊,一个网页里把多层视差,横向滚动,滚动缩放,滚动进度提示都加进去了。主视觉的3D物体用了橙色的果冻材质包裹白色的类等高线线条也是我非常喜欢了,后面可以把goodcase的页面做一个升级看看,到时候再出一篇。

最后来看看这三个模型的写作能力怎么样。

之前测试的时候,我都是让他们写一个1000字的科技故事,看看有没有反转到我。

但我最近真的是看到了一个爆炸级别的写作方式,所以我真的很想让这三个模型根据这一段,自己去搜索对应的类似片段,然后把它总结成为一个写作skill,看看地道不地道。

把skill做出来后,他们都有一个主题,就是描述第一次用AI的场景。

这是gpt6 luna写的,感觉不太到有学到里面的反差感,是有点点心里巨大波动后平静的感觉但是不多。

这个是gpt6 sol写了,更难绷住了。

刚开始是有点感觉,排比句开始有那种味道了,但是后面的又收回来了。就是上面用的那句桂林山水甲天下是有点莫名其妙,实际上能感觉到这种就是很美滋滋的感觉啊,美不胜收。

但是盘古开天辟地,我负责坐在旁边,真的完全没有震撼感。

opus5.5有那种荒谬的感觉,但是轮到我有点没get到最后这句飞流直下三千尺是想表达的啥。

所以我追问了一句啊,Opus5给出的回复是用桂林山水甲天才来类比美极了,那用飞流直下三千尺来比喻壮观也是很可以的,enmmm,行吧。

测high了我再多测一个case吧,直接上Blender测应用操作和3D类测试了,让这三个模型用3D的方法来复现我最爱的kunkun舞蹈,顺便给这三个模型的多模态能力也上个压力。

提示语没有写很复杂的,

读取视频里的主要角色,用blender做建模,按照视频里的镜头移动拍出来白模视频,通过颜色来区分背景,物体和人物。

luna直接拉完了,拉穿地心了,kun变蜘蛛侠了快。

然后就是gpt6 sol,场景切换,人物走位,用颜色区分背景这些是做出来了。

我发现这个跳舞类做3D视频真的是个超级超级难啊,之前我做《你的名字》那段经典楼梯的转场的时候,基本上能完全把主角复刻出来了。但这里的人物数量错误了,动作也没有想象中的那么灵活。

Opus5.5属于是跟gpt6 sol四六开的感觉,在建模的情况下,脸部没有那么多细节,但是手部和腿部的关节会更多,多了个胯骨轴,更加灵活。对于场景的区分也更加明显了。但是它在做场景切换的时候,会出现镜头突然往不是主角的方向去偏移,就是一个很突兀的放大,这在原片里面是没有的。

最后的最后,在测试过程中,我必须要爆赞一下GPT-6 sol的速度!

在能力维持得相当不错的情况下,它这个速度真的是我最近几代用GPT最爽的一次。基本上之前看到要跑五六分钟的任务,现在在一分钟左右都能够搞定,看来额度又要不够用了。

就希望后面不要神一阵鬼一阵的,过几周就来个大降智。

OK,三个模型测下来都早上7点了,按我说就Anthropic你也别四处说要减缓AI的发展速度了,奔走奔走让大家模型分开时间发吧,这个实用多了,我可太爆炸想睡觉了,早安午安晚安朋友们。

作者 / 卡尔 & yc星辰

本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 虽然现在各家都放额度、降价格,但Sol之前速度神一阵鬼一阵的问题确实存在,要是赶项目deadline的话,还是优先用Opus更稳,毕竟速度再快,出错了返工更费时间。

    来自广东 回复