Qwen3.8-Max gagne en ampleur avec un modèle géant et un contexte de 1 million de tokens

Alibaba rend Qwen3.8-Max largement disponible et promet ses poids ouverts la semaine prochaine. Le modèle accepte texte, image et vidéo, avec une fenêtre de 1 million de tokens et un positionnement très ambitieux sur les usages agentiques.

Alibaba a rendu Qwen3.8-Max largement disponible, avec une promesse de poids ouverts la semaine prochaine. Ce modèle mélange d’experts de 2,4 trillions de paramètres accepte du texte, des images et de la vidéo, puis renvoie du texte, ce qui le place d’emblée sur les usages les plus lourds en entreprise. La version hébergée est utilisable dès maintenant, tandis qu’un second checkpoint, Qwen3.8-27B, doit aussi passer en open weights. Le sujet compte car il touche à la fois l’accès aux modèles géants, les coûts d’inférence et la possibilité de déploiement sur site.

Un modèle géant, mais pas pour les mêmes usages selon l’artifact

Qwen3.8-Max, modèle de type mixture-of-experts, n’est pas l’option la plus simple à faire tourner en interne. Alibaba ne publie pas le nombre de paramètres activés, ce qui empêche pour l’instant d’estimer proprement la charge de service, et le checkpoint reste présenté comme un artefact multi-nœuds de datacenter. À l’inverse, Qwen3.8-27B vise un déploiement plus classique sur GPU on-premise. En clair, l’un sert surtout via API ; l’autre ressemble davantage au candidat que les équipes infra peuvent réellement ranger dans leur salle serveur, si elles aiment encore entendre les ventilateurs tourner.

La compatibilité annoncée avec les API OpenAI et DashScope réduit aussi le coût d’intégration côté produit. Une simple modification de base URL et d’identifiant de modèle suffit, selon Alibaba. Ce n’est pas qu’un détail technique : pour les éditeurs de logiciels, les intégrateurs et les équipes data, cela change la vitesse de test, puis de mise en production.

Fenêtre géante, tarification lisible, et quelques chiffres qui parlent

La fiche publique met en avant une fenêtre de contexte de 1 million de tokens, avec un maximum d’entrée de 991 000 tokens, ou 983 000 en mode “thinking”. Le maximum de sortie atteint 131 000 tokens dans les deux cas, et le budget de raisonnement monte à 262 000 tokens. Les limites de débit annoncées sont de 2 millions de tokens par minute et 15 000 requêtes par minute. Autrement dit, le modèle vise des charges où l’on ingère des corpus entiers, pas seulement des prompts pressés.

La grille tarifaire suit la même logique. Alibaba affiche 2,00 dollars par million de tokens en entrée, 6,00 dollars par million en sortie, et 0,25 dollar par million pour les lectures de cache implicite. La création de cache explicite coûte 2,50 dollars, contre 0,17 dollar pour sa lecture. Le cache d’entrée est donc huit fois moins cher que l’entrée fraîche, ce qui rend la stabilité du préfixe plus décisive que la longueur brute du prompt.

Ce que le modèle vise vraiment : code, documents, médias

Alibaba rattache la version aux métiers du génie logiciel, de la revue de documents juridiques et financiers, des opérations médias et e-commerce, ainsi que du design. Les cas d’usage cités vont des agents de programmation à l’échelle d’un dépôt au stockage de connaissances sur de longs documents, en passant par l’indexation de vidéos longues, l’extraction de données structurées et les assistants de recherche multi-étapes.

La liste des outils intégrés va dans le même sens. La Responses API inclut notamment code_interpreter, web_search, web_extractor, t2i_search et i2i_search, tandis que le support couvre aussi les appels de fonction, les sorties structurées, les lots, la complétion de préfixe et le fine-tuning. Les développeurs y verront surtout une boîte à outils plus qu’un simple chat de plus.

Des scores solides, mais pas sans zones grises

Alibaba publie un tableau de benchmarks complet avec cette sortie. Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1, devant Claude Opus 4.8 et Claude Fable 5 à 84,6, mais derrière GPT-5.6 Sol (max) à 88,8. Le modèle affiche aussi 67,7 sur SWE-bench Pro, contre 80,0 pour Fable 5, et 73,5 sur FrontierSWE, contre 88,8 pour Fable 5. En revanche, il prend la tête sur PaperBench avec 93,0, sur IFBench avec 82,8, et sur plusieurs mesures visuelles, dont OSWorld-Verified à 86,1, Parametric CAD Bench à 91,5 et OmniDocBench 1.5 à 92,1.

Les progrès par rapport à la génération précédente sont nets sur les tâches agentiques et multimodales : DeepSWE passe de 21,6 à 56,6, FrontierSWE de 40,7 à 73,5, et JobBench de 31,3 à 53,4. Toutefois, deux précautions s’imposent. D’une part, le tableau multimodal compare Qwen3.8-Max à Qwen3.7-Plus, pas à Qwen3.7-Max, ce qui rend le saut générationnel plus flatteur [à vérifier]. D’autre part, la courbe de scaling RL d’Alibaba culmine à 0,725 autour de 4 000 environnements d’entraînement avant de retomber à 0,719 puis 0,689, ce qui rappelle que tous les gains ne montent pas en ligne droite.

Points clés

  • Qwen3.8-Max est désormais largement disponible chez Alibaba.
  • Les poids ouverts arrivent la semaine prochaine, selon Alibaba.
  • Qwen3.8-Max compte 2,4 trillions de paramètres.
  • Le contexte annoncé atteint 1 million de tokens.
  • Qwen3.8-27B est le chemin le plus réaliste pour l’on-premise.
  • Terminal-Bench 2.1 affiche 86,6 pour Qwen3.8-Max.

En chiffres

  • 1 million de tokens — fenêtre de contexte annoncée par Alibaba.
  • 2,00 dollars — prix par million de tokens en entrée.
  • 6,00 dollars — prix par million de tokens en sortie.
  • 15 000 requêtes par minute — limite de débit annoncée.
  • 2,4 trillions de paramètres — taille totale du modèle Qwen3.8-Max.

À lire