Die OpenAI-Entwicklerdokumentation "Image Generation"-Seite bietet eine zentrale Erklärung zu den Möglichkeiten zur Bilderzeugung und -bearbeitung: Entwickler können direkt über die Image API generieren, bearbeiten oder Variationen generieren (Varianten sind nur in DALL verfügbar· E 2 wird unterstützt), und "image_generation" kann auch als integriertes Werkzeug in der Responses-API für mehrrundige konversationelle iterative Umstrukturierung und flexiblere Eingabemethoden verwendet werden (Datei-ID als Bildeingabe). Das Dokument bietet außerdem einen Modellvergleich, in dem festgestellt wird, dass gpt-image-1.5 derzeit das Hauptmodell der GPT-Image-Serie ist, und fordert DALL· E 2 und DALL· E 3 wurde als veraltet markiert und soll die Unterstützung am 12. Mai 2026 beenden.
Was die Ausgabesteuerung betrifft, listet das Dokument einstellbare Parameter wie Größe, Qualität, Format, Kompression und Hintergrundtransparenz auf und bietet eine automatische Option, um das Modell automatisch wie aufgefordert auszuwählen. Die Standardausgabe sind base64-kodierte Bilddaten; Die Formate sind png, jpeg, webp, wobei JPEG im Allgemeinen besser zur Verringerung der Latenz ist. Der transparente Hintergrund muss auf transparent eingestellt werden und ist nur unter PNG und WebP mit mittlerer oder hoher Qualität verfügbar. Kosten und Latenz sind direkt proportional zu den zu generierenden Tokens: Größere Größe und höhere Qualität erhöhen die Ausgabetoken deutlich; Wenn Sie partial_images für die Streaming-Generierung verwenden, werden Sie für jedes "Teilbild" zusätzlich belastet. Die Dokumentation legt außerdem nahe, dass einige Organisationen möglicherweise eine API-Organisationsvalidierung durchführen müssen, bevor sie GPT-Image-Modelle verwenden.
Häufig
gestellte Fragen F: Was ist der Hauptinhalt dieses Dokuments "Bildgenerierung"?
A: Das Dokument erklärt, wie man Bilder mit der OpenAI-API generiert und bearbeitet, und vergleicht die anwendbaren Szenarien und Fähigkeiten der Bild-API und der Responses-API.
F: Welche Modelle werden zuerst für die Bilderzeugung empfohlen?
A: Das Dokument empfiehlt die GPT Image-Serie und betont GPT-image-1.5 als hochwertigere Option und gpt-image-1-mini für geringere Kosten.
F:DALL· Kann E 2/3 weiterhin verwendet werden und wann wird es eingestellt?
A: Das Dokument ist mit DALL· gekennzeichnet. E 2 und DALL· E 3 ist eingestellt und soll die Unterstützung am 12. Mai 2026 beenden.
F: Wie erzeugt man transparente Hintergrundbilder und welche Formate werden unterstützt?
A: Hintergrund auf transparent stellen; Transparent unterstützt nur PNG und WebP, und mittlere bis hohe Qualitätseinstellungen sind im Allgemeinen stabiler.
F: Was sind die Hauptfaktoren, die von den Kosten der Bilderzeugung beeinflusst werden?
A: Die Gebühren hängen mit Token zusammen, und je größer die Größe und je höher die Qualität, desto teurer ist es. Die Verwendung von Bearbeitungs- oder Hi-Fi-Eingaben erhöht die Eingabetoken und partial_images auch zusätzliche Ausgabetokengebühren.