过去两年出现的 AI 图像模型中,首个真正进入专业工作流的是 GPT-Image-2(也叫 ChatGPT Images 2.0),由 OpenAI 于 4 月 21 日发布。
第二名落后 242 分,而它在 LM Arena 文生图榜单取得的成绩为 1512 分。
若以模型差距作参照,DALL-E 到 Nano Banana Pro 的代差与之大致相当。
OpenAI 于 2026 年 4 月 21 日推出了新一代原生多模态图像生成模型 GPT-Image-2,其内部代号为 Spud。
在承接 DALL-E 3 继任者角色的同时,它也完成了对 GPT-Image-1.5 的全面升级。
1.生图前规划、生图后自检:原生 Thinking 模式
一张图在接入 OpenAI O 系列推理模型后,须走完创建 → 打草稿 → 生成初稿 → 搭建场景 → 打磨细节 → 收尾 → 润色 → 微调这套八步流程;这正是 GPT-Image-2 架构层面最核心的创新。
整个过程还能够联网搜索、检查错误并反复修正。也就是说,当你要求它制作财报信息图时,它会先联网获取最新数据,然后绘图,并在完成后自行核对数字是否有误。
从架构层面看,所有 Diffusion 模型都无法做到这一点。
2.由世界知识驱动
真实产品所遵循的视觉规律也体现在 GPT-Image-2 的生成结果中,原因是其训练数据明显倾向 UI 截图、店面招牌、真实界面布局等真实视觉素材。
3. 分镜中的角色一致性
能够生成系列化物料,例如同一个 IP 形象在 8 个不同场景中的图片
4.像素级的局部编辑
对指定区域进行修改时,其余部分基本不会发生漂移。
如今只需一句自然语言,就能替代 PS 里“手动抠图改细节”的动作,同时完整维持阴影、光照与透视的一致性。
| 分辨率 | Medium 质量 | High 质量 |
|---|---|---|
| 1536×1024(1.5K) | $0.04/张 | $0.16/张 |
| 2560×1440(2K) | $0.06/张 | $0.22/张 |
| 3840×2160(4K) | $0.10/张 | $0.40/张 |
从 4 月 21 日开始,包括免费用户在内的所有 ChatGPT 用户都可以使用 GPT-Image-2;不过免费用户仅能使用 Instant Mode(即时模式),Thinking Mode 位于付费墙之后。
生成上限在高峰期为 3 张;平时采用每 24 小时滚动窗口计算额度,数量为 2~3 张。
具体操作步骤:
任务一旦涉及股价、汇率、新闻热点等实时数据,可用一个鲜少有人提及的技巧:直接要求先联网查最新数据再画图,系统便会自动组合 web search + 图像生成链路。
如果不清楚订阅GPT的方法,可以查看我之前发布的文章。