OpenAI发布ChatGPT Images 2.5:生图提速50%,局部改图更精准

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:2,318

摘要:OpenAI发布ChatGPT Images 2.5,新版更强调在编辑中保留未被指定修改的画面内容,开发者可根据出图速度和精细编辑需求选择不同模型。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】AI生图正在从“生成一张图片”,走向围绕同一张图片持续修改。当地时间9月8日,OpenAI发布新一代图像模型ChatGPT Images 2.5。新版本图像生成延迟最高降低50%,同时提升参考图保真、精准编辑和多轮修改的一致性。简单来说,过去用户让AI换一件衣服、改一个背景,画面里其他已经满意的部分也可能跟着变化。现在新模型更强调只修改用户指定的部分。

这次升级还改变了用户操作AI生图的方式。OpenAI为ChatGPT加入Sketch、模板和图片评论编辑等功能,用户既可以直接画草图表达想要的构图,也可以在图片上指出具体需要修改的位置。面向开发者,OpenAI同步推出GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst,前者主打速度和高频生成,后者用更长的生成时间换取更精细的编辑控制。

OpenAI披露,目前用户每周通过ChatGPT Images和API中的GPT-Image系列模型生成超过30亿张图片。ChatGPT Images 2.5已开始向ChatGPT、ChatGPT Work和Codex各层级用户推出,覆盖网页、桌面和移动端;Flare和Sunburst已在API开放。

局部编辑更可控

相比单纯提高画质,Images 2.5更值得关注的变化,是提升图片修改的稳定性,并让用户更直接地指出“怎么改、改哪里”

AI生图过去一个常见的问题是,第一张图可能已经基本符合要求,但继续修改时,人物、构图或其他已经确定的内容也可能随之变化。例如用户只想更换人物服装、商品背景或海报中的一行文字,重新生成却可能改变整张图片。OpenAI称,Images 2.5提升了精准编辑能力,可以调整用户指定的内容,同时尽量保留原有主体、构图和视觉风格。通过Images API,开发者也可以针对产品、背景或文字等单个元素进行修改。

新版本还强化了多轮编辑和参考图保真。OpenAI展示的立方体旋转、旅行信息图和生日蜡烛等案例,都需要围绕同一张图片连续调整。Images 2.5在后续编辑中更强调延续此前已经完成的内容,减少主体、构图和细节在多轮修改中发生偏移。用户提供人物、宠物等参考照片后,模型也可以在更换场景、风格或构图时,尽量保留主体的识别特征。上述表现均来自OpenAI展示的案例,实际效果仍会受到图片和指令复杂程度影响。

除了模型能力升级,OpenAI还加入Sketch、模板和图片评论编辑等功能,降低用户对复杂文字提示词的依赖。根据OpenAI更新日志,用户可以在移动端绘制草图,让模型据此生成图片;也可以在生成图片上添加评论,指出需要修改的位置。模板则提供海报、商品图片等常见创作起点,但目前尚未在ChatGPT Work模式开放。用户分享生成图片时,还可以选择附上所使用的提示词,方便其他用户替换照片和细节后继续生成。

这些功能分别帮助用户确定画面构图、选择创作起点和指定修改位置。对广告、商品图片等需要反复调整的场景而言,Images 2.5的重点不只是生成第一张图片,而是让用户能够围绕已经确定的素材继续编辑。

API拆成“跑量”和“精修”两条路线

在ChatGPT端增加草图和图片标注等交互功能的同时,OpenAI也把新一代图像能力开放给开发者,并推出两款定位不同的API模型。

GPT-Image-2.5 Flare是面向大多数应用场景的默认模型,侧重生成速度、图片质量和编辑能力。OpenAI称,与GPT-Image-2相比,Flare生成图片的延迟降低50%,适用于社交内容、产品体验、视觉搜索、快速原型和大规模图片生成等场景。

GPT-Image-2.5 Sunburst则面向需要精细编辑的创意工作。与侧重速度的Flare相比,Sunburst使用更长的生成时间,以提高多次修改过程中的控制能力。OpenAI列出的应用场景包括广告营销素材和产品图片等对成品质量要求较高的任务。

两款模型反映了企业使用AI图片时的两类需求。社交内容、快速原型和大批量图片生成更看重出图速度,而广告素材、产品精修等工作则更看重修改的可控性和最终效果。对于开发者而言,同一代图像模型由此可以根据具体业务在速度和精细控制之间选择,而不是所有任务都采用同一种生成方式。

OpenAI此次公布的早期客户反馈中,也有人特别提到编辑控制能力。Higgsfield AI产品负责人Axultan Alimkulov表示,Flare给他留下深刻印象的一点,是模型能够理解哪些内容“不应该改变”。对于影视、UGC和广告团队,这意味着修改一个元素时,可以尽量保留原有角色、构图和视觉风格。

从“生成图片”走向商业图片工作流

在提升编辑能力之外,Images 2.5也在处理更复杂的商业视觉任务。

OpenAI展示的案例已经从单一人物或产品图片扩展到旅行信息图等复杂页面,需要同时处理多张图片、不同层级的文字和页面布局。其他官方案例还覆盖海报、请柬、信息图、科普图和产品宣传图等不同类型,重点测试模型能否在同一条指令中同时处理画面结构、文字、视觉风格和具体元素。

从此次升级的组合来看,OpenAI图像产品的重点正在从“生成第一张图”进一步延伸到图片生成之后的修改和生产:一方面通过精准编辑、参考图保真和多轮一致性,让同一份素材可以继续使用;另一方面通过Flare和Sunburst分别覆盖快速出图和精细编辑。对于每周已经生成超过30亿张图片的ChatGPT Images和GPT-Image API而言,接下来竞争的不只是一次生成效果,也包括AI图片能否更稳定地进入持续创作和实际生产流程。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

25
10
分享
上一篇 下一篇