Qwen3.8-Flash-Next mise sur un calcul plus léger pour préparer Qwen4

Alibaba dévoile Qwen3.8-Flash-Next, une architecture ouverte de préversion pensée pour réduire les coûts d’inférence. Le modèle n’active que 6 milliards de paramètres sur 125 milliards, avec un angle européen déjà sensible.

Le Qwen team d’Alibaba a publié Qwen3.8-Flash-Next, une préversion ouverte de l’architecture qui doit servir de base à Qwen4. Le modèle affiche 125 milliards de paramètres, mais n’en active que 6 milliards à chaque token généré, avec une priorité claire : faire baisser la facture d’inférence quand les usages à très long contexte et les agents deviennent la norme. Cette fois, le message est moins “regardez la taille” que “regardez ce que ça coûte”.

Une architecture pensée pour dépenser moins à l’usage

Le choix de Qwen3.8-Flash-Next s’inscrit dans une logique de calcul parcimonieux. Alibaba le compare à Qwen3.7-Plus, qui compte 397 milliards de paramètres et en active 17 milliards, soit environ trois fois plus de calcul actif que cette nouvelle version. Autrement dit, la course ne se joue pas seulement sur la puissance brute ; elle se joue sur le nombre de paramètres réellement mobilisés quand le modèle répond.

Quatre changements structurent cette architecture. Trois sont assez classiques pour les spécialistes : un schéma de sparse attention qui travaille par micro-blocs plutôt qu’en sélectionnant des tokens un à un, un mécanisme résiduel de type “gated” qui filtre ce qui traverse les couches, et une recette d’entraînement qui supprime le warmup de batch-size. Le quatrième élément attire davantage l’œil. Au lieu d’ajouter des experts, le modèle ajoute 51 milliards de paramètres sous forme d’embedding séparé, indexé par des fragments de deux et trois caractères. Selon l’équipe, ce choix coûte moins de calcul et se déporte plus facilement vers des accélérateurs limités en mémoire.

Des choix techniques qui disent aussi quelque chose du marché

Cette orientation n’est pas neutre. Concevoir pour des puces à la mémoire contrainte, c’est aussi travailler dans un contexte où les meilleurs accélérateurs ne sont pas toujours accessibles. Les contrôles à l’export ont mis les laboratoires chinois dans cette position, et Qwen3.8-Flash-Next ressemble à une réponse d’ingénierie très concrète. L’idée n’est pas de magnifier le modèle sur une fiche produit, mais de lui permettre de tourner plus souvent et à moindre coût. Ce n’est pas très glamour, mais une facture d’inférence, elle, ne s’émeut pas.

Les chiffres publiés par Alibaba restent à prendre pour ce qu’ils sont : des mesures maison. TNW a relevé ce mois-ci que l’entreprise présentait Qwen3.8 comme le deuxième meilleur modèle du monde sans apporter de preuve indépendante, et les scores annoncés proviennent toujours des propres bancs de test de l’équipe. Le modèle card précise aussi que la note obtenue au Humanity’s Last Exam a été évaluée par GPT-4o, et non par le correcteur officiel du benchmark. C’est une forme de transparence, pas une garantie de neutralité.

L’Europe regarde la licence de près

Le point le plus sensible pour les acteurs européens n’est pas technique, mais juridique. Les poids du modèle sont disponibles sur Hugging Face sous une licence qwen-community, et TNW a rapporté le 7 août qu’Alibaba souhaite facturer ses plus gros utilisateurs commerciaux. Cette distinction compte, car l’article 53(2) du AI Act retire deux obligations de documentation aux modèles publiés sous une licence libre et open source, tandis que le considérant 103 précise que les composants fournis contre paiement ou monétisés ne devraient pas bénéficier de l’exemption.

À ce stade, la question n’est pas tranchée [à vérifier], mais elle pèse déjà sur les usages. Thomson Reuters a bâti son modèle sur Qwen, ce qui signifie qu’une évolution de licence se répercuterait au-delà des seuls clients directs d’Alibaba. Dans ce contexte, les équipes produit, les juristes et les achats ne regarderont pas seulement le score sur un benchmark ; ils regarderont aussi la ligne qui dit qui peut utiliser quoi, et à quelles conditions.

Points clés

  • 125 milliards de paramètres, dont 6 milliards activés par token.
  • Qwen3.7-Plus active 17 milliards sur 397 milliards.
  • TNW a signalé le 7 août une monétisation possible pour grands clients.
  • Article 53(2) du AI Act et considérant 103 sont au centre du débat.
  • Thomson Reuters utilise déjà un modèle basé sur Qwen.

En chiffres

  • 125 milliards — paramètres de Qwen3.8-Flash-Next, selon Alibaba.
  • 6 milliards — paramètres activés par token, selon Alibaba.
  • 397 milliards — paramètres de Qwen3.7-Plus, selon Alibaba.
  • 17 milliards — paramètres activés par token sur Qwen3.7-Plus, selon Alibaba.
  • 7 août — date de l’information de TNW sur la licence.

À lire