GPT Image est la famille de modèles de génération et d'édition d'images d'OpenAI, successeur de DALL·E.
Nativement multimodaux, ces modèles comprennent à la fois le texte et les images pour produire des visuels de qualité professionnelle.
Depuis le lancement du premier GPT-Image en mars 2025, ils ont redéfini les standards de la création visuelle par IA. La génération actuelle, ChatGPT Images 2.5, sortie le 8 septembre 2026, se décline en deux moteurs API complémentaires : Flare pour la vitesse, Sunburst pour la précision.

<div style="text-align: right; font-size: 75%; margin-top: -20px; margin-right: 1ex" class="text-secondary-600 text-right small"><em>
Dernière mise à jour : 11/09/2026
</em></div>
<aside> ⭐
</aside>
<aside> 🗞️

08/09/26 - OpenAI lance ChatGPT Images 2.5 et deux nouveaux modèles API : Flare et Sunburst.

21/04/26 - OpenAI révèle son nouveau champion de la génération d’images.

07/04/26 - Un leak révèle le nouveau générateur d’images d’OpenAI.

17/12/25 - OpenAI annonce GPT-Image 1.5 avec des capacités d’édition avancées (et une meilleure qualité)
</aside>
GPT-Image est le nom de la famille de modèles d'intelligence artificielle intégrée à ChatGPT pour générer des images à partir de prompts textuels, avec une précision remarquable dans le respect des consignes.
Côté grand public, OpenAI parle de ChatGPT Images (version 2.5 depuis septembre 2026). Côté développeurs, chaque version correspond à un ou plusieurs identifiants API.
La famille compte aujourd'hui, par ordre d'ancienneté :
À noter : DALL·E 2 et DALL·E 3 ont été définitivement fermés le 12 mai 2026. OpenAI concentre désormais toute son offre image sur la branche GPT Image.
Avant GPT Image, OpenAI proposait DALL·E 2 et DALL·E 3, des modèles de diffusion dédiés à la génération d'images. Ces modèles fonctionnaient de manière séparée du reste de l'écosystème GPT : ils recevaient un texte, produisaient une image, sans vraiment "comprendre" le contexte.
GPT Image change de paradigme. Il s'agit d'un modèle nativement multimodal basé sur une architecture de transformer (la même famille technologique que les grands modèles de langage comme ChatGPT). Concrètement, cela signifie que le modèle traite le texte et l'image comme un seul flux d'information, ce qui lui confère une compréhension du monde et des instructions très supérieure à ses prédécesseurs.
Contrairement à DALL·E 3 qui "traduisait" un texte en image via deux systèmes distincts, GPT Image raisonne directement sur le contenu visuel : il peut ainsi modifier une image existante de façon chirurgicale, intégrer du texte lisible dans une scène, comprendre des références culturelles implicites.