mt logoMyToken
ETH Gas
EN

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

Favoritecollect
Shareshare

作者: 晓静 ,腾讯科技

编辑:徐青阳,腾讯科技

美国当地时间9月8日,OpenAI发布了最新生图模型ChatGPT Images 2.5。

新版本重点提升了图片编辑、参考图保真和多轮修改的一致性。用户连续修改一张图片时,前面已经调整好的内容更容易保留下来。修改人物、产品或背景时,也更容易只改变指定部分。生成速度最高比Images 2.0快50%。

同时,ChatGPT增加了Sketch、Templates和图片评论功能。用户可以直接画草图作为参考,也可以在图片上标记需要修改的位置。开发者则可以通过API使用GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst。

OpenAI称,目前用户每周通过ChatGPT Images和API中的GPT-Image模型生成超过30亿张图片。Images 2.5已经向ChatGPT、ChatGPT Work和Codex用户开放,覆盖网页、桌面和移动端。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

AI生图真正麻烦的地方,往往出现在第一张图生成以后。比如人物已经满意,只想换衣服。产品已经确定,只想换背景。海报已经做好,只想改一行字。过去继续修改时,图片里的其他部分也可能跟着发生变化。

Images 2.5把精准编辑放在了重要位置。 OpenAI给出的案例包括“全身编辑”和“多城市旅行票”。这些演示都采用连续图片展示修改过程,重点看模型能否按照指令调整指定内容,同时保留原来的主体、构图和其他细节。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

“多城市旅行票”这个案例比较容易理解。图片中如果只需要改变其中一项信息,模型需要识别具体修改对象,同时维持整张票的设计结构。对于产品图、广告素材、品牌海报来说,这种能力比单纯生成一张漂亮图片更实用。

另一个重点是多轮编辑。OpenAI展示了“立方体旋转”“旅行信息图”和“生日蜡烛”三个案例。它们都不是生成一次就结束,而是连续进行多次修改。OpenAI希望证明的是,前面的修改能够继续保留下来,后面的操作不会不断破坏已经完成的内容。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

这也是Images 2.5这次升级最值得关注的地方。

X用户@thesoragirls做了一个很直接的测试:在图片中画出蜡烛,同时指定一片花瓣保持不变,再观察模型修改其他区域时是否会动到原来的内容。她的测试结果显示,被固定的花瓣得到了保留,其他部分按照要求发生了变化。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

不过,连续编辑并没有完全解决细节问题。日本动画制作师@genel_ai在实际测试中发现,虽然官方强调多次编辑后画质能够保持,但当编辑不断叠加时,图片仍可能出现锯齿和质感变化。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

也就是说,2.5在稳定性上有所改善,但复杂场景下仍会出现画质损失。

Images 2.5的第二个变化,是对参考图片的处理。

用户可以提供人物、宠物或者其他主体的照片,再要求它进入新的场景、换一种视觉风格或者改变构图。OpenAI称,新版本更容易保留人物的识别特征,同时改善光线和纹理表现。

官方一次给出了五个案例:“重新设计的婴儿肖像”“穿着服装的狗”“照相亭头像”“多人派对合成照片”和“整理床铺”。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

这几个案例覆盖了不同情况。婴儿肖像和照相亭头像主要看人物特征能否保持;狗的案例看主体换装后还能不能维持原来的形象;多人派对合成照片则涉及多个人物同时出现在一张图里;“整理床铺”则更接近日常图片编辑,需要对原始场景进行具体调整。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

这种能力对需要连续使用同一个人物、产品或者品牌素材的工作比较重要。API用户可以基于同一张参考图生成不同版本,减少每次重新生成时出现明显变化的情况。

复杂画面也是这次官方案例的重点。OpenAI展示了一张20世纪50年代风格的家庭插画:一家人站在巨大的圆柱形太空栖息地前,里面包含绿色景观、湖泊和未来建筑。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

OpenAI官方介绍页展示了一个宜昌旅行页面:把旅行目的地、景点信息、图片和文字内容放在同一张页面里,整体做成一份完整的旅行攻略。它需要同时处理多张图片、不同层级的文字和页面布局,不能只把单个元素做好。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

还有一组九宫格的中世纪现代主义海报,每张海报都有不同的几何图形和文字,包括“Create”“Grow together”“Choose kindness”。

另一张图是旧金山街道的印象派画面,街道从彩色房屋之间向下延伸,可以看到海湾和金门大桥。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

此外还有奶油金色的Lake Como婚礼请柬、倒置未来城市、八张美国国家公园复古邮票、太阳耀斑科普幻灯片、蓝金色地球马赛克、ChatGPT贴纸海报,以及雨夜未来城市。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

这些案例覆盖了插画、海报、请柬、信息图、科普图和产品宣传图等不同类型。OpenAI想展示的重点也比较明确:当Prompt同时规定画面结构、文字、视觉风格和具体元素时,Images 2.5能够更完整地执行这些要求。

时尚创业者雅娜·维兰德(Yana Welinder)测试后认为,Images 2.5在时尚设计上的表现有明显提升。她此前使用旧模型时,参考设计能够保留下来,但最终效果有时比较平;她认为2.5能够让原本的设计呈现出更完整的视觉效果。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

但也有人给出了相反的测试结果。AI与软件工程师马克·克雷奇曼(Mark Kretschmann)专门进行了森林场景的噪声和伪影测试。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

他认为2.5虽然有不少改进,但测试结果并不稳定。随后他又把Images 2.5和Images 2.0进行对比,认为自己测试的多个案例中,2.0在真实感方面反而更好。

所以,目前更准确的判断是,Images 2.5重点改善了编辑控制和复杂指令处理,但不同图片类型下的实际效果仍有差异。

除了模型本身,OpenAI还给ChatGPT增加了几个新的操作方式。

最直接的是Sketch。用户可以在ChatGPT里直接画草图,然后让模型根据这张草图生成最终图片。比如想设计一个房间,可以先画出大致布局;想做一件衣服,可以先画出轮廓;甚至只是随手画一个很粗的构图,也可以交给ChatGPT继续完成。之后再补充视觉风格和其他要求即可。

使用时输入“@Sketch”就可以调用。这实际上减少了对文字Prompt的依赖。有些构图很难靠语言描述,尤其是物体的位置、比例和大致轮廓。现在用户可以先画,再让模型补全。

X用户@fquolodasha测试后,对GPT-Image2.5的手绘能力评价很高, 直言这次效果“有点牛”,并感叹OpenAI近期的更新速度和能力提升都很猛。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

Templates解决的是另一个问题。ChatGPT新增了一些常见创作格式,例如Poster和Merch。用户先选择模板,再填写想表达的信息、设计元素和视觉风格,不需要每次面对一张空白画布从头开始。

图片分享也增加了Prompt选项。用户现在可以分享图片时,同时分享生成这张图片所使用的Prompt。别人拿到后,可以换成自己的照片和细节继续生成。

OpenAI给出的例子是一张20世纪80年代风格的人像:卷发、彩色夹克、金链、霓虹灯和音乐播放器。其他用户可以沿用这个思路,把自己的照片换进去。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

Images 2.5也同步进入API。OpenAI推出GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst。

Flare是默认版本,重点放在速度、质量和编辑能力。OpenAI称,它比GPT-Image-2生成质量更高,同时延迟降低50%,适合社交内容、产品体验、视觉搜索、快速原型以及大量图片生成。

Sunburst则更偏向需要精细控制的工作,例如正式广告素材和高质量产品图片。它允许更长的生成时间,用来换取更高的编辑精度。

OpenAI公布的早期用户反馈,也集中在编辑控制上。

Higgsfield AI产品负责人阿克苏尔坦·阿利姆库洛夫(Axultan Alimkulov)特别提到,Flare能够较好理解哪些内容应该保持不变。对于影视、UGC和广告团队来说,这意味着修改一个元素时,可以尽量保留原来的角色、构图和视觉识别。

连续创业者@gkxspace则把这次更新放到了商业图片工作流里观察。他认为,过去AI生图最大的限制之一,是第一张图可能很好,但很难继续基于它稳定制作第二张、第三张。Images 2.5在连续编辑、速度和参考图保真上的变化,让电商换装、品牌素材延展和连续插画等场景更有实际使用空间。

ChatGPT Images 2.5来了:这次,其他生图模型真的要紧张了

目前,Images 2.5已经覆盖ChatGPT、ChatGPT Work和Codex用户,API中的Flare和Sunburst也同步开放。OpenAI同时保留了提示词和图片安全检查、C2PA元数据以及不可见水印等机制,用于识别由其工具生成的图片。

从官方案例和目前的用户测试来看,这次更新的重点很集中:让图片生成之后的修改更容易控制,让参考图在连续使用时更稳定,再把Sketch、模板和图片标注这些操作补进工作流。

至于真实感、细节和多轮编辑后的画质,现有测试已经出现了不同结果。Images 2.5最终能把这些问题改善到什么程度,还需要更多实际使用来验证。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup