Qwen-Image-2.1 unifie génération et retouche dans un seul modèle
Alibaba présente Qwen-Image-2.1, un modèle qui regroupe génération de texte en image, retouche et fond transparent. La version réduit la taille du système tout en gardant le support multi-références et une disponibilité immédiate pour la recherche.
Alibaba, via l’équipe Qwen, a publié Qwen-Image-2.1, un modèle de génération et d’édition d’images qui réunit plusieurs usages dans un seul checkpoint. L’annonce vise autant les chercheurs que les équipes produit, avec un support immédiat dans Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V. Le sujet compte car le modèle promet moins de briques à assembler et une meilleure maîtrise des coûts d’inférence, sans ouvrir la porte au déploiement commercial sans licence séparée.
Un seul modèle pour écrire, retoucher et détourer
Qwen-Image-2.1 prend en charge la génération texte-vers-image, l’édition multi-références, les retouches locales et la sortie RGBA transparente. En pratique, un même pipeline peut créer une image, modifier une scène à partir de plusieurs références, puis produire un fond transparent sans basculer vers un autre modèle. C’est plus simple à intégrer, et nettement moins pénible pour les équipes qui veulent éviter l’empilement de composants.
Le modèle repose sur un transformeur de diffusion de 7 milliards de paramètres, organisé en 32 couches single-stream, et sur un encodeur Qwen3-VL de 8 milliards de paramètres. Le premier gère la génération visuelle, le second encode le texte et les images de conditionnement dans une représentation commune. À cela s’ajoute un autoencodeur VAE RGBA à 64 canaux, avec compression spatiale x16, pour les images à transparence native.
Pourquoi Alibaba parle d’un modèle plus “économe”
La version précédente, Qwen-Image, avait été lancée en août 2025 avec 20 milliards de paramètres et un checkpoint séparé pour l’édition. Qwen-Image-2.1 fusionne ces fonctions dans un ensemble plus compact, autour d’un tiers de la taille annoncée pour le modèle initial. L’équipe Qwen le décrit comme le modèle “the most balanced and cost-effective” de la série Qwen-Image.
Le gain vient aussi de l’architecture d’attention. Les jetons de texte suivent un masque causal, tandis que les jetons d’image utilisent une attention bidirectionnelle par blocs. Qwen appelle cela une attention à granularité mixte. Le système calcule les textes et les images de référence une fois, puis réutilise ce cache pour les étapes suivantes de débruitage. Résultat : plus il y a d’images de référence, plus l’économie de calcul devient visible.
Ce que le modèle sait faire concrètement
Qwen-Image-2.1 accepte jusqu’à 10 images de référence. Les exemples fournis par l’équipe montrent un groupe composé à partir de six portraits, ou encore une tenue reconstruite à partir de cinq références. Le modèle peut aussi cibler une zone précise avec des cercles, des annotations peintes ou des masques séparés, tout en préservant l’identité des personnes et des produits.
Autre point mis en avant : la sortie native en 2048 x 2048, avec sept formats supportés jusqu’à 2752 x 1536. L’équipe cite aussi des progrès sur la typographie, l’éclairage des portraits, les panoramas, les infographies, les storyboards et les essayages virtuels. Bref, le modèle ne cherche pas seulement à faire de jolies images ; il veut aussi rester utile dans des workflows concrets.
Des scores élevés, mais sur le benchmark de Qwen
Sur Qwen-Image-Bench, le benchmark interne de l’équipe, Qwen-Image-2.1 obtient 60,28 points au total. Le score place le modèle devant Nano Banana 2.0, à 59,82, ainsi que devant tous les modèles open-weight listés par Qwen. FLUX 2 Max, annoncé comme un modèle ouvert de 32 milliards de paramètres, atteint 55,33. En face, six modèles fermés font mieux, avec GPT Image 2.5 Sunburst en tête à 67,01.
Ces chiffres donnent une indication utile, mais ils restent à lire avec prudence puisque le classement provient de Qwen lui-même [à vérifier]. Pour autant, la hiérarchie suggère que l’équipe cherche moins à battre tout le monde sur un seul critère qu’à proposer un compromis entre qualité, taille et coût d’exécution.
Déploiement, licences et matériel pris en charge
Le modèle est disponible pour la recherche et l’évaluation, avec une prise en charge dès le premier jour dans Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V. Pour l’usage commercial, Qwen indique qu’une licence distincte est nécessaire. La distribution couvre aussi les GPU AMD Radeon via ROCm et plusieurs plateformes de puces via FlagOS.
Sur le plan pratique, Qwen fournit un exemple Python pour générer une image depuis un prompt, et la même pipeline sert à l’édition avec une ou plusieurs images en entrée. Les serveurs d’inférence peuvent activer la quantification FP8, le cache KV de préfixe, CUDA Graph et le parallélisme tensoriel. Pas de magie noire, juste beaucoup d’ingénierie pour éviter que la facture de calcul ne grimpe trop vite.
Points clés
- Qwen-Image-2.1 fusionne génération et édition dans un seul checkpoint.
- Le modèle affiche 7B paramètres visuels et un encodeur 8B.
- Jusqu’à 10 images de référence sont prises en charge.
- Qwen annonce un score de 60,28 sur son benchmark interne.
- La sortie initiale couvre Diffusers, ComfyUI, vLLM-Omni et SGLang.
- Une licence séparée reste nécessaire pour l’usage commercial.
En chiffres
- 7B paramètres — composant visuel du transformeur, selon Qwen.
- 8B paramètres — encodeur Qwen3-VL utilisé par le pipeline.
- 10 images — maximum de références acceptées en édition multi-références.
- 60,28 points — score sur Qwen-Image-Bench, benchmark interne de Qwen.
- 2048 x 2048 — résolution native par défaut annoncée pour la génération.