Qwen-Image-2.1 unit génération et édition d’images

Alibaba Qwen lance Qwen-Image-2.1, un modèle unique pour créer et retoucher des images. La version regroupe génération, édition locale, références multiples et transparence RGBA, avec support logiciel immédiat.

Alibaba, via son équipe Qwen, a publié Qwen-Image-2.1, un modèle unique qui rassemble génération d’images, retouche locale, édition multi-référence et sortie transparente RGBA. L’intérêt est simple : un seul checkpoint remplace plusieurs briques, ce qui réduit la complexité de déploiement pour la recherche comme pour l’évaluation. À ce stade, l’usage commercial reste soumis à une licence séparée de Qwen.

Un seul modèle pour créer, corriger et détourer

Qwen-Image-2.1 combine plusieurs usages dans un même système. Le modèle accepte du texte, des images de référence et des masques pour modifier une zone précise, tout en gardant l’identité d’une personne ou d’un objet quand c’est demandé. Il peut aussi produire des images avec transparence native, ce qui vise des cas concrets comme les visuels produit, les compositions graphiques ou l’extraction de sujets.

Dans les faits, Qwen présente ce modèle comme une évolution plus compacte que la première version de Qwen-Image. Le modèle initial, lancé en août 2025, pesait 20 milliards de paramètres et séparait génération et édition. La nouvelle version ramène la partie de génération visuelle à 7 milliards de paramètres sur 32 couches DiT à flux unique, tandis que l’encodeur Qwen3-VL 8B traite le texte et les images d’entrée. Résultat : moins de briques à orchestrer, mais pas une machine de poche non plus.

Pourquoi la technique compte autant que le résultat

La partie intéressante se joue dans l’architecture. Qwen utilise un masque causal au niveau des jetons texte, puis un masque bidirectionnel par bloc d’images. Cette approche, qu’il appelle « mixed-granularity attention », permet de traiter le contexte une fois, puis de réutiliser un cache KV de préfixe pendant les étapes de débruitage. En clair, les images de référence et les instructions textuelles ne sont pas recalculées à chaque tour. Cela devient utile dès qu’on multiplie les références, car le coût de calcul grimpe vite.

Le modèle vise aussi des usages plus “production” que certains modèles de démonstration. Qwen met en avant la typographie, les portraits, les panoramas, les infographies et les storyboards, avec une sortie native en 2048 × 2048 par défaut et sept rapports d’aspect supportés jusqu’à 2752 × 1536. Pour les équipes qui bricolent des visuels toute la journée, c’est moins glamour qu’un cocktail à base de pixels, mais beaucoup plus concret.

Des outils déjà disponibles, mais une licence à regarder de près

Qwen indique une prise en charge dès le lancement sur plusieurs environnements : Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V. La documentation mentionne aussi un déploiement sur GPUs AMD via ROCm, ainsi que sur huit plateformes de puces via FlagOS. Pour les équipes techniques, cela réduit le délai entre test local et intégration dans une chaîne de production.

Reste le point juridique. Le modèle est annoncé pour la recherche et l’évaluation, mais la licence de Qwen impose une autorisation distincte pour un usage commercial. C’est un détail qui n’en est pas un, surtout pour les acteurs qui espèrent transformer une belle démo d’image générée en produit facturable. Le passage du prototype à l’exploitation, lui, continue de demander un peu de paperasse.

Points clés

  • Qwen-Image-2.1 réunit génération et édition dans un seul checkpoint.
  • Le modèle accepte jusqu’à 10 images de référence.
  • La sortie native RGBA vise les visuels transparents et les détourages.
  • Qwen annonce un score de 60,28 sur son benchmark interne.
  • Le lancement s’appuie sur Diffusers, ComfyUI et vLLM-Omni.
  • Le premier Qwen-Image est sorti en août 2025.

En chiffres

  • 7 milliards — paramètres de la partie génération visuelle, selon Qwen.
  • 8 milliards — paramètres de l’encodeur Qwen3-VL, selon Qwen.
  • 10 images — maximum de références acceptées pour l’édition.
  • 2048 × 2048 — résolution native par défaut annoncée.
  • 60,28 — score global sur Qwen-Image-Bench, selon Qwen.

À lire