GPT Image 2.5来了,OpenAI开始抄Banana的作业

0 评论 266 浏览 0 收藏 16 分钟

OpenAI深夜发布GPT Image 2.5,将改图能力作为核心卖点,强调精确编辑与多轮一致性。然而,这些功能在谷歌Nano Banana上早已实现。本文对比两代模型,解析升级幅度与行业竞争格局,探讨OpenAI是否真的完成了补课。

GPT Image 2.5凌晨突发,把改图能力端了出来。

局部编辑、连续编辑、多轮一致性乃至图片上直接标注修改,OpenAI这次把“无需抽卡,拥抱多轮修改”当成了主菜。

但问题是,这菜多少有点没新意——同样的东西,NanoBanana一年前就已经玩过了。

NanoBanana一代就已经把连续编辑做成了核心能力;第一代发布四个月后,谷歌连可视化圈选编辑的产品交互都做了;到大香蕉(Pro)那里,谷歌已经把这条路往前走到了相机、灯光、构图和多主体控制;二代香蕉又把Pro的核心能力压到了Flash的速度。

OpenAI也算是补了NanoBanana的课,但显然还没毕业。

01 修改效果更好

抛开“新不新”这个问题,GPT Image 2.5这次的升级幅度其实不算小。

OpenAI自己把重点写得很明确:更精确的编辑、更稳定的多轮一致性,以及更快的生成速度。

相比Images 2.0,新模型最高可以降低50%的生成延迟,同时改善参考图主体保真度、自然光照和纹理表现。

但在官方文档里被OpenAI反复强调的,还是“编辑”。

首先是Precision Editing(精确编辑)。

之前的Image 2.0虽然也能改,但往往改得不够精准,只想动一个局部,整张图却可能跟着大变样,图片主体的位置甚至都会发生偏移。

GPT Image 2.5试图把这种“牵一发而动全身”压下去,OpenAI称,新模型可以只修改用户指定的元素,同时尽可能保持主体、构图、背景乃至品牌视觉不变。即使面对更复杂的主体和背景,也可以单独替换商品、文案或者局部元素。

更重要的是Multi-turn Editing Consistency(多轮编辑一致性)

简单来说,就是一张图改完第一轮之后,可以直接接着改第二轮、第三轮;此前已经做好的修改尽量保留下来,新一轮修改继续建立在上一轮结果之上,而不是每次重新理解、重新生成。

OpenAI专门强调了一个过去很麻烦的问题:图片质量不应该随着编辑轮数增加而一路劣化。

体现在gif图里,就是图不停改,但不再乱动,看起来更稳定。

GPT Image 2.5这次把API分成两个版本:偏速度的Flare(闪光)和偏最高质量的Sunburst(翻译过来是“从云隙射下的阳光”,只看名字的话,应该有更强的光影效果和更高的审美);要我说,OpenAI最近和有什么起名癖似的,尽整些花里胡哨的。

在Arena最新公布的结果里,Sunburst和Flare直接包揽了文生图、单图编辑和多图编辑三个竞技场的第一、第二名。加上Image 2,前三已被GPT Image包圆。

不过需要区分的是,Arena这里测的是“多图输入编辑”,并不是OpenAI官方强调的“多轮图像编辑”。

更值得注意的是它们相对GPT Image 2的提升幅度。

Sunburst在文生图上提高了40分,单图编辑提高59分,多图编辑则直接提高了81分;Flare分别提高18、30和47分。

至少在大模型盲测竞技场上,Image 2.5这次最明显的提升,集中在对已有图片的编辑能力上,尤其是同时处理多张参考图的复杂编辑任务。

在API侧,Flare被OpenAI定义为默认模型,相比GPT Image 2在获得更高质量的同时,延迟降低50%;Sunburst则牺牲一些速度,换取更精细的控制,主要面向广告素材、商品图等场景。

定价方面,OpenAI最新价格页显示,GPT Image 2.5 Flare和Sunburst的图像输入都是8美元/百万token、图像输出30美元/百万token、文本输入5美元/百万token,和GPT Image 2一毛一样。

有意思的是,Flare和Sunburst一个主打速度,一个主打质量,但API账单暂时看不出区别,合理怀疑OpenAI又出bug了。

02 还有什么变化

相比Midjourney更容易让人想到“把一张图片做得更有风格”,OpenAI更喜欢把文字、图片、布局和信息揉在一起,直接生成一个视觉成品。

比如海报、商品素材、信息图、人物照片、品牌视觉,以及各种带有大量文字和排版的设计——Image 2.5在这方面和Image 2一脉相承。

但和Image 2更强调“一次生成就能直接拿来用”不同,Image 2.5这次把大量展示空间留给了改图,即一张已经生成好的图,还能不能继续往下改。

OpenAI称,新模型把人物放进新的场景、风格和构图之后,更容易保留原有主体的辨识度,光线和纹理也会更自然。

除了模型本身,OpenAI这次还补充了两个“新功能”。

一个是Sketch(草图),在移动端输入@Sketch之后,用户可以直接随手画出自己的想法,再让GPT Image根据草图继续生成。

能画出来,就不用费劲描述。

不过这并不是什么新玩法,Nano Banana能做,Adobe Firefly能做,国内的腾讯混元、通义万相、Seedream也早已支持线稿、涂鸦或者辅助线控制生成。

OpenAI这次只是把这套已经很成熟的交互搬到了GPT里。

另一个功能则更像是在鼓励大家“抄作业”,OpenAI把它叫作Pass your best ideas along。

现在分享一张ChatGPT生成的图片时,可以顺手把Prompt一起带出去,别人拿到后可以换上自己的照片和细节直接复刻。

然而,Gemini早就可以把包含Prompt和生成图片的完整对话分享出去,别人甚至可以直接接着这段对话继续生成;Nano Banana后来还在Google Messages里做了Remix,让好友围绕同一张图片来回接力修改。

OpenAI还有得学呢……

03 网友怎么说

虽然前面在吐槽OpenAI“补课”,但到了真正上手的时候,还是得承认一件事:GPT Image 2.5确实是一款很强的生图模型。

发布之后,社群很快玩出了新花样。

目前传播最广的玩法,是用Image 2.5做定格动画。

开发者Charlie Guo拿GPT Image 2.5连续生成了一组画面,再把它们串成动画。这条帖子发布后浏览量迅速破万,并被多名OpenAI员工转发。

更进一步,还有人开始直接从草图生成动画素材。

比如下面这位网友,先随手画出一个拿着球棒的小猴子草图,再让GPT Image 2.5生成一整组动作连续的序列帧,最后拼成GIF动画。整个过程只需寥寥几笔,模型就能扩展成一个完整的12帧的gif动画。

做动画之外,还有一批人盯上了用Image 2.5生成透明底素材。

开发者Konstantine专门测试了Sunburst生成透明背景图的能力,认为它现在输出的透明底素材已经非常漂亮,并直接点名游戏开发者和设计师可能会拿它来做东西。

有了透明底,人物立绘、游戏道具、UI图标、商品素材,就可以直接往网页、游戏或者设计稿里塞。

还有人开始暴力测试它的复杂指令理解。

Reddit上一名用户使用了一个近乎故意找茬的Prompt:要求一张图同时出现四种画风、五条项链、14根手指、三个瞳孔的鸽子眼睛,以及15世纪莫桑比克丛林和未来工厂。

结果……当然没有全部实现,但他的评价是:“不完美,但仍然比之前任何一次都好。”

一些更日常的变化也开始被用户注意到。

有人对比Image 2和2.5后认为,新模型的人物表情没那么僵,皮肤质感更自然;有人觉得画面透视、反射和构图明显更合理;还有人拿Image 2和Image 2.5用同一套提示词做了漫画,2.5的分镜更活,角色表情更夸张,镜头远近和场景细节也会跟着剧情变化。相比之下,Image 2更像把一组漂亮插画拼在一起。

Image 2(左),Image 2.5(右)

对于真正把AI图片放进工作流的人,感受可能更加直接。

一名正在用ChatGPT给游戏制作房间素材的用户说,Image 2最大的问题之一就是连续编辑两三次之后,图片往往已经劣化到不能用了,实际工作时基本等于必须第一轮就抽中满意结果。

换到2.5之后,他的评价是“Big improvement”,反复修改造成的画质衰减明显少了。

当然,Image 2.5也没有突然把所有老毛病一起治好,变成一个全能的完美生图模型。

目前也已经有人继续提到几个老问题::手偶尔还是会画坏;Image 2时代就有人吐槽的棋盘格/高频噪声没有彻底消失;一些画面仍然会出现颗粒、像素化或者过度锐化。也有做AI商品摄影的用户认为,如果要求严格还原产品本身,NanoBanana 2和Pro目前依然更可靠。

包括上面提到的游戏制作房间素材的用户,也表示他“原以为自己可以放弃使用Gemini了”,但“ChatGPT和Grok中的过多微细节处理实在太过激进了”。

甚至在最基础的指令遵循上,社群评价也并不是一边倒。有用户认为尽管2.5的文字、细节和构图更好了,但复杂指令偶尔还是会被模型“理解成另一个意思”。

GPT Image 2.5没有重新发明AI生图,也没有在每一个维度上把Nano Banana、Seedream们甩在身后。

但“别人早就有”与“它做得不够好”,显然是两码事。GPT Image 2本来就很强,2.5更像是在把过去明显的短板——编辑精度、多轮一致性和可持续修改——补得更完整了。

至少,对于ChatGPT庞大的用户群来说,现在用GPT生图可以少抽几次卡了。

作者:袁心玥 编辑:王靖

本文由人人都是产品经理作者【字母榜】,微信公众号:【字母AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Pexels,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!