OpenAI開発者向けのドキュメント「画像生成」ページは、画像生成と編集機能の集中説明を提供しています。開発者は画像APIを通じて直接、編集、またはバリエーションを生成できます(バリアントはDALL· E 2 支援)、そして「image_generation」は、Responses APIの組み込みツールとしても使用可能で、複数ラウンドの会話による反復再構築やより柔軟な入力方式(画像入力としてのファイルID対応)が可能です。 また、モデル比較も行われており、gpt-image-1.5が現在主要なGPT Imageシリーズモデルであることを示し、DALL· E 2とDALL· E 3は非推奨とマークされ、2026年5月12日にサポート終了予定です。
出力制御に関しては、サイズ、品質、フォーマット、圧縮、背景透明度などの調整可能なパラメータが記載されており、モデルが自動選択されるオプションも提示されています。 デフォルトの出力はbase64符号化された画像データです。 フォーマットはpng、jpeg、webpで、一般的には遅延削減に適しています。 透明背景は透明に設定する必要があり、PNGとWebPでのみ利用可能で、品質は中〜高です。 コストとレイテンシは生成に必要なトークン数に比例します。サイズが大きく品質が高いほど出力トークンが大幅に増加します。 ストリーミング生成にpartial_imagesを使用する場合、「部分的な画像」ごとに追加料金が発生します。 また、一部の組織ではGPT画像モデルを使用する前にAPI組織化検証を行う必要がある場合もあると示唆されています。
よくある質問
Q: この「画像生成」文書の主な内容は何ですか?
A: この文書はOpenAI APIを使った画像の生成・編集方法を説明し、Image APIとResponses APIの適用シナリオや機能を比較しています。
Q: 画像生成に最初に推奨されるモデルはどれですか?
A: 文書ではGPT Imageシリーズの使用を推奨しており、より高品質な選択肢としてgpt-image-1.5、低コストのgpt-image-1-miniを重視しています。
Q:DALL· E 2/3は今後も使用可能で、いつ停止されるのでしょうか?
A: 文書にはDALL· E 2とDALL· E 3は非推奨で、2026年5月12日にサポート終了予定です。
Q: 透明な背景画像の生成方法と、どのフォーマットがサポートされていますか?
A: 背景を透明に設定; トランスペアレントはPNGとWebPのみをサポートし、中〜高品質の設定は一般的に安定しています。
Q: 画像生成コストに影響する主な要因は何ですか?
A: 手数料はトークンに関連しており、サイズが大きく品質が高いほど高価になります。 編集やハイファイ入力を使うと入力トークンが増加し、partial_imagesも追加の出力トークン手数料が発生します。