Qwen3.8-Max pousse l’open source vers les tâches agentiques

Qwen présente Qwen3.8, une nouvelle génération de modèles ouverte autour de Qwen3.8-2.4T-A95B et de Qwen3.8-Max. L’ensemble met l’accent sur le code, les tâches longues et l’exécution d’agents, avec un contexte pouvant atteindre 1,01 million de tokens.

Qwen a présenté Qwen3.8, sa nouvelle génération de modèles ouverte, avec Qwen3.8-2.4T-A95B comme base post-entraînée au format Hugging Face et Qwen3.8-Max comme version officielle enrichie. L’enjeu est clair : mieux tenir les tâches de code, de recherche et d’exécution autonome, dans un marché où les modèles ne sont plus jugés seulement sur leurs réponses, mais sur leur capacité à aller au bout d’un travail. Le modèle est annoncé comme compatible avec vLLM, SGLang et TokenSpeed, et pensé pour un usage API ou en infrastructure dédiée.

Une montée en gamme pensée pour les agents, pas pour les démonstrations

Qwen décrit Qwen3.8 comme sa génération ouverte la plus capable à ce jour. La famille repose sur l’architecture de Qwen3.5, mais gagne en fiabilité sur les tâches longues, avec un meilleur suivi des environnements, un raisonnement réglable et une compatibilité élargie avec les outils d’intégration. Dit autrement : le modèle ne cherche pas seulement à répondre vite, il cherche à finir ce qu’on lui demande. Et, pour une fois, ce n’est pas juste un slogan qui brille dans une slide de salon.

Le cœur technique de Qwen3.8-2.4T-A95B reste massif. La fiche mentionne 2,4 trillions de paramètres au total, 95 milliards activés, 92 couches, 512 experts et un contexte natif de 262 144 tokens, extensible jusqu’à 1 010 000 tokens. Qwen précise aussi que le modèle est text-only, impose le mode thinking et ne permet pas de désactiver ce raisonnement. Pour les équipes produit ou infra, cela signifie une chose simple : il faut prévoir de la place, du calcul et un peu de discipline dans le déploiement.

Ce que change Qwen3.8-Max pour les usages métiers

Qwen3.8-Max, version officielle basée sur Qwen3.8-2.4T-A95B, ajoute des fonctions plus proches d’un service prêt à l’emploi : entrée visuelle, support non-thinking, contexte d’1 million de tokens par défaut et outils intégrés. Qwen met aussi en avant une API Cloud managée pour ceux qui ne veulent pas maintenir leur propre infrastructure. La logique est lisible : garder une base ouverte pour la communauté, mais proposer au-dessus une couche plus industrialisable pour les entreprises.

Sur les benchmarks fournis par Qwen, Qwen3.8-Max se situe souvent au niveau des meilleurs modèles testés, sans les dépasser partout. Il obtient notamment 86,6 sur Terminal Bench 2.1, 67,7 sur SWE-bench Pro, 73,5 sur FrontierSWE, 93,0 sur PaperBench et 75,1 sur AndroidBench. Sur plusieurs tests d’agents, la version se montre plus solide que Qwen3.7-Max, mais reste derrière certains concurrents sur des mesures comme Terminal Bench 2.1 ou DeepSWE 1.1. Les chiffres suggèrent donc une progression nette, pas une domination générale [à vérifier sur les protocoles externes].

Le vrai sujet : intégrer sans se noyer dans la tuyauterie

Qwen recommande d’utiliser ses API pour une intégration plus fluide, tout en rappelant que des moteurs comme SGLang, vLLM et TokenSpeed conviennent aux charges de production. Les paramètres de génération proposés sont assez standard pour ce type de modèle, avec temperature à 1.0, top_p à 0.95 et top_k à 20. Le point plus sensible reste le contrôle du raisonnement : reasoning_effort peut être réglé sur xhigh, medium ou low, et preserve_thinking est activé par défaut. Pour les développeurs, cela ouvre un vrai arbitrage entre coût, vitesse et profondeur d’analyse.

Dans ce contexte, Qwen3.8 ne vise pas seulement les benchmarks de laboratoire. Il essaie de s’installer comme une brique crédible pour le code, les workflows complexes et les assistants qui enchaînent plusieurs actions. Le marché des modèles ouverts avance vite, et la barre monte d’un cran à chaque version. Qwen s’y aligne en poussant davantage l’usage “agentique”, celui où le modèle ne bavarde pas seulement, mais agit.

Points clés

  • Qwen3.8-Max s’appuie sur Qwen3.8-2.4T-A95B.
  • 2,4T paramètres au total, 95B activés.
  • Contexte natif : 262 144 tokens.
  • Extensible jusqu’à 1 010 000 tokens.
  • Qwen cite Terminal Bench 2.1, SWE-bench Pro et PaperBench.
  • Qwen Team publie la citation en août 2026.

En chiffres

  • 2,4T paramètres — modèle Qwen3.8-2.4T-A95B, fiche technique Qwen.
  • 95B activés — même modèle, architecture MoE.
  • 262 144 tokens — contexte natif annoncé par Qwen.
  • 1 010 000 tokens — contexte maximal extensible annoncé.
  • 86,6 — score de Qwen3.8-Max sur Terminal Bench 2.1, selon Qwen.

À lire