Dernière mise à jour : 16/05/2025 "> Dernière mise à jour : 16/05/2025 "> Dernière mise à jour : 16/05/2025 ">
<div style="text-align: right; font-size: 75%; margin-top: -40px; margin-right: 1ex" class="text-secondary-600 text-right small"><em>
Dernière mise à jour : 16/05/2025
</em></div>

Sorti début mai 2026, HiDream-O1-Image représente une nouvelle génération d’IA Open-Source et une évolution majeure par rapport à son prédécesseur HiDream-I1. Et la bonne nouvelle pour les utilisateurs de ComfyUI, c’est qu’il est désormais supporté nativement, sans custom node. Voici tout ce qu'il faut savoir pour se lancer.

<aside> ⚡

TL;DR — Utiliser HiDream-O1-Image savecur ComfyUI

HiDream-O1-Image est un modèle open source (licence MIT) qui tient en un seul fichier checkpoint : pas de VAE, pas d'encodeurs séparés. Il fait de la génération texte-image, de l'édition et de la personnalisation par sujet, jusqu'en 2048 × 2048 px.

Vous avez moins de VRAM ou voulez générer plus vite ? Optez pour la version Dev et son workflow alternatif.

</aside>

A propos de HiDream-O1

HiDream-O1-Image est un modèle de génération d'images open source développé par HiDream-ai, publié sous licence MIT qui peut être utilisé librement pour des projets personnels, de recherche ou commerciaux.

Ce qui le distingue fondamentalement des modèles précédents, c'est son architecture : un Pixel-level Unified Transformer (UiT). En clair, là où des modèles comme HiDream-I1 ou Flux.2 s'appuient sur plusieurs composants distincts (un VAE pour compresser l'image et des encodeurs de texte séparés), HiDream-O1-Image fusionne tout dans un seul modèle. Les pixels bruts, le texte et les conditions de génération sont traités dans un espace partagé, sans passer par une représentation latente intermédiaire.

Ce choix architectural simplifie le pipeline de génération et améliore la cohérence entre ce que vous décrivez et ce que le modèle produit, notamment pour les textes intégrés dans les images.

Ce que le modèle sait faire

HiDream-O1-Image n'est pas limité à la simple génération texte-vers-image. En une seule architecture de 8 milliards de paramètres, il gère :

Un agent de "raisonnement" intégré (basé sur Gemma-4) analyse le prompt avant la génération pour mieux interpréter les instructions complexe.

Deux versions, trois formats

Il y a deux versions du modèle, qui correspondent à deux comportements de génération différents :

Pour chaque version, plusieurs formats de quantification sont disponibles, c'est-à-dire différentes façons de compresser les poids du modèle pour réduire l'empreinte mémoire :

Fichier Version Format VRAM requise
hidream_o1_image_fp8_scaled.safetensors Full FP8 ~12 Go
hidream_o1_image_mxfp8.safetensors Full MXFP8 ~10 Go
hidream_o1_image_bf16.safetensors Full BF16 (pleine précision) ~25 Go
hidream_o1_image_dev_fp8_scaled.safetensors Dev FP8 ~12 Go