OpenAI 开发者文档“Image generation”页面对图片生成与编辑能力进行了集中说明:开发者可通过 Image API 直接生成、编辑或生成变体(变体仅 DALL·E 2 支持),也可在 Responses API 中把“image_generation”作为内置工具,用于多轮对话式的迭代改图与更灵活的输入方式(支持以 File ID 作为图片输入)。文档同时给出模型对比,称 gpt-image-1.5 为当前主推的 GPT Image 系列模型,并提示 DALL·E 2 与 DALL·E 3 已标记为弃用,计划于 2026 年 5 月 12 日停止支持。
在输出控制方面,文档列出可调参数包括尺寸、质量、格式、压缩与背景透明度,并提供 auto 选项让模型按提示自动选择。默认输出为 base64 编码图片数据;格式可选 png、jpeg、webp,其中 jpeg 通常更利于降低延迟。透明背景需将 background 设为 transparent,且仅在 png 与 webp 下可用,质量建议 medium 或 high。成本与延迟与生成所需 tokens 成正比:更大尺寸与更高质量会显著增加输出 tokens;若使用 partial_images 进行流式生成,每张“部分图”还会额外计费。文档也提示部分组织在使用 GPT Image 模型前可能需要完成 API 组织验证。
常见问题
Q:这份“Image generation”文档主要讲什么内容?
A:文档说明如何用 OpenAI API 生成与编辑图片,并比较 Image API 与 Responses API 的适用场景与能力差异。
Q:哪些模型建议优先用于图片生成?
A:文档推荐使用 GPT Image 系列,强调 gpt-image-1.5 为更高质量选项,gpt-image-1-mini 偏向更低成本。
Q:DALL·E 2/3 还能继续用吗,什么时候会停?
A:文档标注 DALL·E 2 与 DALL·E 3 已弃用,并计划于 2026 年 5 月 12 日停止支持。
Q:透明背景图片要怎么生成,哪些格式支持?
A:将 background 设为 transparent;透明仅支持 png 与 webp,且中高质量设置通常更稳定。
Q:图片生成费用主要受哪些因素影响?
A:费用与 tokens 相关,尺寸越大、质量越高通常越贵;使用编辑或高保真输入会增加输入 tokens,partial_images 还会产生额外输出 tokens 费用。