Qwen-Image-2.1 et Gander montrent deux voies de l’IA agentive

Alibaba et Tencent présentent deux modèles open-weight qui cherchent à réduire l’écart avec les systèmes fermés. L’un vise l’image, l’autre la conversation continue pendant l’exécution d’une tâche.

Alibaba et Tencent ont publié, le 20 septembre 2026, deux modèles open-weight qui illustrent une même direction de l’IA appliquée : faire plus avec moins de paramètres, tout en gardant une exécution fluide. Qwen-Image-2.1, chez Alibaba, cible la génération et l’édition d’images, tandis que Gander, chez Tencent, veut maintenir une conversation en temps réel pendant qu’un autre module travaille en arrière-plan. Les deux projets restent à ce stade liés à leurs propres tests, sans validation indépendante encore disponible. Et dans les deux cas, la promesse est simple à formuler, mais plus délicate à tenir en production.

Alibaba pousse l’image générative vers l’édition fine

Qwen-Image-2.1, le modèle d’Alibaba pour l’image, revendique seulement 7 milliards de paramètres pour son composant de génération visuelle, avec des performances annoncées supérieures à la plupart des modèles fermés sur le benchmark interne de Qwen. Selon la publication, il peut tourner sur des GPU grand public capables, comme une GeForce RTX 3090. Le modèle gère aussi les images transparentes en RGBA, c’est-à-dire avec un canal de transparence en plus des couleurs, ce qui sert pour détourer des objets ou modifier du texte sur des calques transparents.

Le système accepte jusqu’à dix images de référence en même temps, utile pour des portraits de groupe, des essayages virtuels ou l’aménagement d’une pièce. Des cercles, des masques ou des zones peintes permettent de guider les retouches locales. Alibaba dit aussi avoir revu l’architecture et réutilisé le cache KV, un mécanisme qui conserve des états intermédiaires pour accélérer l’inférence, surtout avec plusieurs images d’entrée. Le modèle est disponible sur Hugging Face, GitHub et Model Scope, avec une démo sur Hugging Face, mais la licence de recherche interdit l’usage commercial sans accord séparé de Qwen.

Gander veut garder le fil pendant qu’un agent travaille

Chez Tencent, Gander prend une autre route : il est conçu pour parler en continu tout en exécutant des tâches complexes en arrière-plan. Le modèle traite la parole, l’image et le texte en parallèle, et l’utilisateur peut l’interrompre à tout moment. Pour cela, les chercheurs ont séparé le système en deux couches. La “cerebellum” gère la conversation seconde par seconde, tandis qu’un “brain” remplaçable prend en charge le raisonnement et les tâches d’agent.

Ce découpage vise à éviter le vieux tic des assistants vocaux qui font attendre l’utilisateur pendant qu’ils réfléchissent. Dans Gander, la partie conversationnelle décide quand écouter, parler ou s’arrêter, sans module dédié à la détection des tours de parole. Le rapport indique qu’elle s’appuie sur environ deux minutes d’historique de conversation. En test, Gander obtient le meilleur timing sur Full-Duplex-Bench v3, avec un démarrage au bon moment dans 100 scénarios sur 100 et 8 % d’interruptions non voulues, contre 13,5 % pour GPT-Realtime et près de 48 % pour le moins bon concurrent mesuré.

Le revers est connu : la précision sur la tâche reste un cran en dessous. Tencent explique que la note globale pénalise aussi les erreurs de reconnaissance vocale et de sortie, tandis que le “brain” seul s’en sort beaucoup mieux quand on lui donne directement du texte. Les performances chutent également sur la compréhension vidéo et audio, notamment pour compter des objets ou les localiser dans une image. Le modèle a été entraîné sur environ 2,7 millions d’exemples, et l’équipe prévoit de publier les poids et les données d’entraînement une fois le processus de mise en open source terminé.

Des modèles plus modulaires, mais pas encore miraculeux

Qwen-Image-2.1 et Gander racontent la même histoire sous deux angles. D’un côté, Alibaba cherche à rendre la génération d’images plus souple, plus légère et plus utile pour l’édition. De l’autre, Tencent tente de casser la monotonie des assistants qui parlent puis exécutent, alors que les usages réels demandent souvent de faire les deux en même temps. Cette spécialisation par modules devient une piste sérieuse, car elle permet de séparer vitesse de conversation et puissance de raisonnement, sans tout faire porter par un seul modèle monolithique.

Le marché observe ça de près. Tencent compare Gander à GPT-Realtime, Gemini Live et Grok, tandis qu’Alibaba positionne Qwen-Image-2.1 face à des modèles fermés plus lourds. Reste un point décisif : les deux annonces reposent encore sur des benchmarks internes ou sur des tests qui ne couvrent pas tous les usages réels. Autrement dit, les briques sont là, la cuisine est déjà avancée, mais le plat n’est pas encore servi partout.

En chiffres

  • 7 milliards de paramètres — composant visuel de Qwen-Image-2.1, annoncé par Alibaba/Qwen, 20 septembre 2026.
  • 10 images de référence — capacité maximale revendiquée pour l’édition d’images chez Alibaba/Qwen.
  • 2,7 millions d’exemples — volume d’entraînement annoncé pour Gander, selon Tencent et son rapport technique.
  • 100 scénarios sur 100 — démarrage au bon moment de Gander sur Full-Duplex-Bench v3.
  • 8 % — taux d’interruptions non voulues de Gander, contre 13,5 % pour GPT-Realtime dans le rapport.

À lire