OpenAI a publié ChatGPT Images 2.5, déplaçant la concurrence de la génération d’images de « savoir si elle peut être générée » à « si elle peut être modifiée en continu ». Le nouveau modèle améliore le détail, la fidélité des sujets des images de référence et la cohérence du montage sur plusieurs tours, réduisant la latence de génération jusqu’à 50 % par rapport à Images 2.0 ; OpenAI affirme que les images ChatGPT et les modèles d’image API ont généré plus de 3 milliards d’images par semaine.
Passage des invites textuelles aux opérations directes
Images 2.5 ajoute des fonctionnalités de croquis, de modèles et de commentaires d’image. Les utilisateurs peuvent esquisser directement dans ChatGPT pour référence, et aussi laisser des commentaires de modification pour des parties spécifiques des images, ne se reposant plus uniquement sur de longues descriptions de prompts.
Le modèle lui-même met également l’accent sur « moins d’erreurs » : lors de la modification d’éléments individuels, essayez de conserver la personne, la composition, l’arrière-plan et les modifications précédentes. Pour les scénarios nécessitant des itérations répétées comme les images de commerce électronique, les supports publicitaires et le contenu social, cela est encore plus crucial que la qualité d’une seule image produite.
Les API sont divisées en deux voies : vitesse et précision
Pour les développeurs, OpenAI a simultanément lancé GPT-Image-2.5 Flare et GPT-Image-2.5 Sunburst. Flare met l’accent sur la haute qualité et la faible latence, la position officielle le positionnant comme le choix par défaut pour la plupart des applications ; Sunburst cible des flux de travail professionnels qui mettent l’accent sur la précision du montage et la qualité finale.
Les deux modèles API prennent en charge à la fois le texte et l’entrée d’images. OpenAI affiche actuellement des prix de sortie image à 30 $ par million de jetons et les entrées d’images à 8 dollars par million de tokens.
Les images IA commencent à rivaliser pour les flux de travail
Images 2.5 est désormais disponible pour les utilisateurs sur les plateformes ChatGPT, ChatGPT Work et Codex, couvrant les plateformes de bureau, mobiles et web. Côté sécurité, les informations source C2PA continuent d’être utilisées, et des filigranes invisibles SynthID ont été ajoutés.
Le cœur de cette mise à niveau n’est pas de créer un autre modèle « meilleur en dessin », mais de tisser croquis, images de référence, annotations partielles et plusieurs cycles de révisions dans un flux de travail unifié de création par IA. La prochaine phase de compétition dans les modèles d’images dépendra probablement de qui se rapprochera d’outils de production véritablement contrôlables et réutilisables.