Qwen3.8-Flash-Next mise sur l’efficacité sans sacrifier le contexte

Alibaba présente Qwen3.8-Flash-Next, un modèle multimodal open-weight pensé pour réduire le coût par jeton. L’architecture combine 125B de paramètres principaux et un contexte natif de 262 144 tokens, extensible à 1 million.

Alibaba a dévoilé Qwen3.8-Flash-Next, un modèle multimodal open-weight conçu pour faire baisser le coût par jeton, tout en gardant une large fenêtre de contexte et des fonctions d’agent. Le modèle, publié par l’équipe Qwen, s’appuie sur une architecture MoE et n’active qu’environ 6 milliards de paramètres par jeton, pour un ensemble qui en affiche bien davantage sur le papier. Le message est clair : viser des usages lourds sans faire exploser l’addition GPU. Pas vraiment le genre de détail qu’on glisse entre le café et la réunion produit.

Une architecture taillée pour la facture, pas pour les posters

Le cœur du modèle combine un backbone de 125 milliards de paramètres, une table d’embeddings n-gram de 51 milliards et un module de prédiction multi-jeton de 4 milliards. L’équipe Qwen décrit aussi quatre changements structurants : un hybride Gated DeltaNet et Qwen Sparse Attention, un mécanisme de Gated Residual, une couche d’embeddings n-gram et l’optimiseur Muon. Autrement dit, la recette cherche à réduire le calcul utile par requête plutôt qu’à gonfler la taille brute pour impressionner le marché.

La partie MoE repose sur 512 experts, avec 10 experts routés plus 1 partagé, et une dimension intermédiaire de 640. Dans cette configuration, les couches alternent trois blocs Gated DeltaNet pour un bloc Qwen Sparse Attention, sur 48 couches au total. QSA, pour Sparse Attention, sélectionne le contexte par micro-blocs plutôt qu’au token près ; c’est plus sobre en calcul, mais pas en stockage.

Un modèle volumineux, donc pas pour le PC du salon

Qwen indique que le checkpoint FP8 pèse 172,78 Gio et que la version BF16 monte à 335,28 Gio. Les recettes vLLM mentionnent TP2 comme configuration minimale validée en FP8 sur GB300, tandis que TP4 est recommandé. Sur un nœud 8×H200, il faut utiliser TEP8 ; le TP8 classique n’est pas compatible avec les blocs de quantification de 128. En clair, le self-hosting demande une vraie grappe multi-GPU, pas un workstation bien coiffé.

Le contexte natif atteint 262 144 tokens et peut s’étendre à 1 000 000 avec YaRN, un mécanisme d’extension de fenêtre contextuelle. Cette capacité vise clairement les usages agentiques, l’analyse de longs documents et le code, où le modèle doit garder le fil sur de longues séquences. L’équipe précise aussi que l’embedding n-gram peut être déchargé vers la mémoire hôte avec préchargement asynchrone, même si cet offload reste limité aux machines NVIDIA.

Des gains de vitesse annoncés, à prendre comme des mesures fournisseur

Alibaba avance un coût d’entraînement d’environ un neuvième de celui de Qwen3.7-Plus. Côté inférence, l’annonce cite des accélérations du kernel QSA allant jusqu’à 7,6× en préfill et 4,9× en décodage à 1 million de tokens ; le cookbook SGLang et les recettes vLLM évoquent, eux, 10,2× et 6,6× [à vérifier]. Il faut donc traiter ces chiffres comme des résultats publiés par l’éditeur, en attendant une mesure indépendante.

Qwen ajoute une donnée de débit : 8,6× le throughput de préfill de Qwen3.7-Plus avec un taux de hit du cache de préfixe de 90 %. L’idée est simple : moins on recalcule ce qui a déjà été vu, plus la machine respire. Et dans l’IA générative, respirer compte souvent plus que briller.

Des performances solides, mais pas partout en tête

Sur les benchmarks publiés, Qwen annonce 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro, 81,0 sur SWE-bench Multilingual et 91,9 sur LiveCodeBench v6. En agentique, le modèle obtient 73,9 sur CoWorkBench, 55,7 sur JobBench et 73,5 sur Toolathlon Verified. En multimodal, il affiche 84,5 sur AndroidWorld, 76,6 sur LVBench, 88,5 sur RealWorldQA et 95,7 sur MathVision avec code interpreter.

Le tableau n’est toutefois pas uniforme. Claude Opus 4.6 (Max) garde l’avantage sur HLE avec 40,0 contre 35,9 pour Qwen3.8-Flash-Next, et DeepSeek-V4-Flash-0731 mène sur NL2Repo-Bench avec 54,2 contre 48,1. Qwen le reconnaît implicitement : le modèle progresse sur l’efficacité et sur plusieurs tâches appliquées, mais le raisonnement de pointe reste un angle mort relatif.

Ce que les développeurs peuvent en faire dès maintenant

Le modèle est servi via vLLM, SGLang, TokenSpeed, transformers serve et llama.cpp pour les quantifications GGUF. L’affinage est annoncé avec Unsloth, Swift et LLaMA-Factory. Qwen3.8-Flash-Next alimente déjà le mode “Standard” de QwenWork et fonctionne avec Qwen Code, tandis que le mode thinking est activé par défaut, avec reasoning_effort réglable sur xhigh, medium ou low.

Pour l’usage, Qwen recommande une température de 1,0 et un top_p de 0,95 en thinking, contre 0,7 et 0,80 en instruct. Les termes changent, mais le principe reste classique : plus la génération est ouverte, plus le modèle explore ; plus elle est contrainte, plus il reste sage. Reste un point pratique à ne pas oublier, surtout si l’on pense commercialisation : la licence annoncée est qwen-community-1.0, et non Apache-2.0 [à vérifier selon l’usage].

Points clés

  • Qwen3.8-Flash-Next active 6B paramètres par jeton.
  • Le contexte natif atteint 262 144 tokens en 2025.
  • 512 experts composent la couche MoE annoncée.
  • Alibaba évoque un coût d’entraînement divisé par neuf.
  • Claude Opus 4.6 (Max) garde l’avantage sur HLE.
  • QwenWork utilise déjà le mode “Standard”.

En chiffres

  • 125 milliards — backbone principal du modèle, selon Qwen.
  • 172,78 Gio — taille du checkpoint FP8, publiée par Qwen.
  • 262 144 tokens — contexte natif annoncé, extensible à 1 000 000 avec YaRN.
  • 7,6× — gain maximal de préfill cité par l’annonce Qwen.
  • 1/9 — coût d’entraînement revendiqué face à Qwen3.7-Plus.

À lire