据量子位9月10日报道,OpenAI发布新一代生图模型ChatGPT Images 2.5,该模型被称为AGI时代的第一个生图模型,主打生成更快、细节更好,改图更接近真实修图,生成延迟相比Images 2.0最多降低50%。OpenAI同时上线两个API模型,面向开发者提供不同质量与速度组合。

按OpenAI介绍,Images 2.5的升级包括生图更快、画面更自然、连续修改多轮时前面改好的细节更容易保持一致,以及支持直接在图片上添加批注。用户可以在图片上圈出要修改的位置并写下要求,模型据此定位修改;新版本还支持在对话框里@Sketch,把手绘草图作为视觉参考,再补充风格和细节生成完整图片。ChatGPT也提供新模板,并显示百分比生成进度。

技术层面,Images 2.5没有继续提高最高输出分辨率,仍为3840px,但新增xhigh和max质量档位,用于提升细节、材质纹理、光照和参考主体保真度。官方演示中,给儿童换衣服后脸部变化较小,原图卷发毛躁质感保留较完整;给小狗换装时主体改对了,但影子后背轮廓似乎仍保留原形状。另一组演示将原始照片还原、放大并重新处理打光。针对电商场景,官方展示不断给人物换衣服、换背景,人物、场景关系和构图能较稳定保留,但部分图片仍有AI塑料感。旅行票券演示则强调多轮编辑一致性,可先替换目的地,再继续修改文字和细节。

对复杂画面、材质和风格指令的理解也有升级。官方演示包括碎玻璃、日杂封面和《银翼杀手》式科幻画面。量子位作者实测输入一张猴子照片,生成四张“猴子在世界各地旅游打卡”图片;有网友用它做定格动画,也有人认为细节已经离谱,但部分区域仍能看出AI涂抹感。手绘草图测试中,大方向能跟随,一些比例关系会出问题。材质和体积感提升较明显,例如鞋子皮革、鞋底、褶皱和立体感更扎实;也有网友反馈细节变好,人物肢体偶尔更容易翻车。

OpenAI面向开发者发布两个API模型。GPT-Image-2.5 Flare强调质量、编辑能力和速度平衡,是官方推荐大多数应用默认使用的版本,适合社交内容、快速视觉原型和大批量生图;GPT-Image-2.5 Sunburst瞄准更精细的创作和编辑需求,例如正式投放的广告素材、产品图片和高画质视觉内容。两者目前采用相同token计费:文本输入每百万tokens 5美元,图像输入每百万tokens 8美元,图像输出每百万tokens 30美元。