GPT Image est la famille de modèles de génération et d'édition d'images d'OpenAI, successeur de DALL·E.
Nativement multimodaux, ces modèles comprennent à la fois le texte et les images pour produire des visuels de qualité professionnelle.
Depuis le lancement du premier GPT-Image en mars 2025 ils ont redéfini les standards de la création visuelle par IA.

<div style="text-align: right; font-size: 75%; margin-top: -20px; margin-right: 1ex" class="text-secondary-600 text-right small"><em>
Dernière mise à jour : 21/04/2026
</em></div>
<aside> ⭐
</aside>
<aside> 🗞️

21/04/26 - OpenAI révèle son nouveau champion de la génération d’images.

07/04/26 - Un leak révèle le nouveau générateur d’images d’OpenAI.

17/12/25 - OpenAI annonce GPT-Image 1.5 avec des capacités d’édition avancées (et une meilleure qualité)

07/05/25 - GTP-Image est désormais aussi utilisable dans ComfyUI via les nouveaux API Nodes.
</aside>
GPT-Image est le nom de la famille de modèle d’intelligence artificielle intégré à ChatGPT pour générer des images à partir de prompts textuels, avec une précision remarquable dans le respect des consignes.
La famille comprend aujourd'hui quatre membres :
Avant GPT Image, OpenAI proposait DALL·E 2 et DALL·E 3, des modèles de diffusion dédiés à la génération d'images. Ces modèles fonctionnaient de manière séparée du reste de l'écosystème GPT : ils recevaient un texte, produisaient une image, sans vraiment "comprendre" le contexte.
GPT Image change de paradigme. Il s'agit d'un modèle nativement multimodal basé sur une architecture de transformer (la même famille technologique que les grands modèles de langage comme ChatGPT). Concrètement, cela signifie que le modèle traite le texte et l'image comme un seul flux d'information, ce qui lui confère une compréhension du monde et des instructions très supérieure à ses prédécesseurs.
Contrairement à DALL·E 3 qui "traduisait" un texte en image via deux systèmes distincts, GPT Image raisonne directement sur le contenu visuel : il peut ainsi modifier une image existante de façon chirurgicale, intégrer du texte lisible dans une scène, comprendre des références culturelles implicites.
Tous les modèles GPT Image partagent les mêmes principes architecturaux (transformer multimodal, inférence auto-régressive sur des tokens visuels) et la même API. Ce qui change entre les versions, c'est la puissance du modèle de langage sous-jacent, les optimisations de vitesse et les capacités d'édition.
| Critère | GPT Image 1 | GPT Image 1 Mini | GPT Image 1.5 | GPT Image 2 |
|---|---|---|---|---|
| Sortie | Avril 2025 | Octobre 2025 | Décembre 2025 | 21 avril 2026 |
| Statut | Disponible | Disponible | Disponible | Recommandé ✅ |
| Architecture | Transformer multimodal (GPT-4o) | Transformer multimodal (allégé) | Transformer multimodal (GPT-5.2) | Nouvelle archi indépendante |
| Vitesse | Référence | +30% vs v1 | 4× plus rapide vs v1 | Proche de GPT Image 1 |
| Texte dans l'image | Bon (~85%) | Correct | Très bon (~95%) | Quasi-parfait (~99%+) |
| Édition préservative | Basique | Basique | ✅ Oui (visage, logos) | ✅ Oui (visage, logos) |
| Formats | 1:1, portrait, paysage | 1:1, portrait, paysage | 1:1, portrait, paysage | multiples, de 3:1 à 1:3 |
| Photorealism | Élevé | Correct | Élevé | Proche photographie réelle |
| Couleurs | Tendance jaune/chaud | Tendance jaune | Tendance jaune réduite | Naturelles ✅ |
| Prix API Moyen | 0,07$ | 0,011$ | 0,04$ | 0,06$ (estimé) |
| Accès | API + ChatGPT | API uniquement | API + ChatGPT | API + ChatGPT |
| Identifiant API | gpt-image-1 |
gpt-image-1-mini |
gpt-image-1.5 |
gpt-image-2 |