Qwen 3.8-Max d’Alibaba mise sur les agents IA de longue durée

Alibaba a dévoilé Qwen 3.8-Max le 3 août, avec 2 400 milliards de paramètres annoncés et une fenêtre d’un million de tokens. Le modèle vise surtout les tâches longues et l’automatisation, avec un retour attendu de l’open-weight.

Alibaba a dévoilé lundi 3 août Qwen 3.8-Max, un modèle d’intelligence artificielle présenté comme l’un des plus avancés du moment par le groupe chinois. Avec une architecture annoncée à 2 400 milliards de paramètres et une fenêtre de contexte d’un million de tokens, il vise surtout les usages longs, de la programmation à l’automatisation de processus. L’enjeu dépasse la simple démonstration technique : la bataille se joue désormais sur la capacité des modèles à tenir la distance, pas seulement à répondre vite.

Un modèle géant, mais pas tout entier mobilisé à chaque requête

Qwen 3.8-Max repose sur une architecture de type Mixture of Experts, ou MoE, une approche qui n’active qu’une partie du modèle à chaque requête. Selon Reuters, environ 95 milliards de paramètres seraient sollicités simultanément sur les 2 400 milliards annoncés par Alibaba. Ce choix permet de viser de hautes performances sans faire tourner tout le moteur à chaque tour de piste.

Le groupe met aussi en avant une fenêtre de contexte d’un million de tokens. En pratique, cela permet de traiter de très gros volumes d’informations dans une même interaction, ce qui compte pour l’analyse documentaire, le code ou les workflows complexes. La promesse est claire : moins de découpage, plus de continuité.

Des agents capables d’enchaîner les tâches

Alibaba insiste moins sur la conversation que sur l’exécution. Qwen 3.8-Max aurait été évalué dans des scénarios où le modèle doit planifier plusieurs étapes, utiliser des outils externes et ajuster ses actions selon les résultats. C’est le terrain des agents IA, c’est-à-dire des systèmes qui ne se contentent plus de générer du texte, mais pilotent une suite d’actions.

L’entreprise cite un exemple parlant : le développement logiciel autonome. Selon Alibaba, le modèle aurait travaillé plus de dix jours sur un projet informatique à partir d’un environnement vierge, en produisant du code, en corrigeant des erreurs et en améliorant progressivement le résultat. Si la démonstration tient, elle confirme un mouvement de fond dans le secteur : les fournisseurs veulent vendre de la persistance, pas seulement de la réponse instantanée.

Des scores élevés, mais à lire avec le périmètre des benchmarks

Alibaba met en avant plusieurs résultats d’évaluation. Sur PaperBench, un test qui mesure la capacité d’une IA à reproduire en code les résultats d’un article scientifique, Qwen 3.8-Max aurait obtenu 93,0 sur 100, contre 88,8 pour Fable 5 d’Anthropic et 80,3 pour Claude Opus 4.8. Sur OSWorld, benchmark qui évalue l’usage d’un ordinateur comme un humain, le modèle aurait atteint 86,1, soit le meilleur score annoncé parmi les modèles testés.

Ces chiffres donnent une indication utile, mais ils restent liés à des bancs d’essai précis, avec leurs règles et leurs biais. Pour les entreprises, la vraie question sera plus prosaïque : coût d’usage, fiabilité sur la durée, intégration aux systèmes internes et niveau de contrôle des données. Les benchmarks font briller les slides ; la production, elle, réclame autre chose.

Le retour annoncé de l’open-weight

L’autre information marquante concerne la stratégie de diffusion. Alibaba a indiqué que les poids de Qwen 3.8-Max seraient prochainement mis à disposition des développeurs, avec la possibilité de personnaliser le modèle et de le déployer sur leurs propres infrastructures. Au moment du lancement, cette ouverture n’était pas encore effective : le modèle restait accessible via l’API du groupe.

Ce positionnement peut peser dans la concurrence entre acteurs américains et chinois. En revenant vers l’open-weight, Alibaba cherche à séduire les équipes techniques qui veulent plus de contrôle qu’un simple service fermé. Pour les développeurs, cela veut dire une marge d’adaptation plus large. Pour le marché, c’est une nouvelle façon de compter les cartes.

En chiffres

  • 2 400 milliards de paramètres — architecture annoncée par Alibaba, 3 août.
  • 95 milliards de paramètres — activation simultanée estimée par Reuters.
  • 1 million de tokens — fenêtre de contexte annoncée pour Qwen 3.8-Max.
  • 93,0/100 — score revendiqué sur PaperBench.
  • 86,1 — score annoncé sur OSWorld.

À lire