Qwen3.8-Omni-Flash mise sur l’agentique multimodale

Alibaba Qwen a lancé Qwen3.8-Omni-Flash, un modèle multimodal centré sur l’exécution d’actions. Disponible en API, il prend texte, image, audio et vidéo en entrée, mais renvoie seulement du texte.

Alibaba Qwen a publié Qwen3.8-Omni-Flash, un modèle multimodal présenté comme son premier système « omni-modal » pensé autour de capacités agentiques. Le modèle accepte du texte, des images, de l’audio et de la vidéo, puis renvoie du texte ; l’idée est de comprendre, planifier, agir avec des outils, puis restituer le résultat. La mise à disposition est immédiate en API, mais sans poids ouverts au lancement, donc pas d’installation locale pour l’instant.

Un modèle qui regarde, écoute et agit, mais parle seulement en texte

Qwen3.8-Omni-Flash s’appuie sur l’architecture Qwen3.8-Flash-Next et vise des usages où l’agent ne se contente pas de classer du contenu. La logique annoncée est celle d’un enchaînement en plusieurs temps : analyse du média, sélection des éléments utiles, usage d’outils, puis réponse finale. C’est plus sobre qu’un assistant qui veut tout faire en même temps, et souvent plus efficace.

Selon la documentation QwenCloud, le modèle gère un contexte d’1 million de tokens, avec 991K en entrée maximale et 131K en sortie maximale. Le raisonnement peut monter jusqu’à 262K tokens, et la fonction de « thinking » est activée par défaut ; elle se désactive avec le paramètre none. Les développeurs peuvent l’appeler via les protocoles DashScope et OpenAI, avec Chat Completions et Responses API, ainsi que le function calling, la recherche web, les sorties structurées, le cache de contexte et les appels par lots.

La vidéo longue, nouveau terrain de jeu des agents

L’un des apports mis en avant par l’équipe de recherche Qwen concerne l’analyse de longues vidéos. Plutôt que de faire défiler un fichier de bout en bout, le modèle part de la question, choisit quoi regarder et écouter, puis rassemble des indices par étapes grossières puis fines. Ce découpage concentre le calcul sur les passages utiles, au lieu de nourrir la machine avec tout le film. Pas très cinéphile, mais très pratique.

Sur OmniVideoBench, l’équipe dit faire passer l’exactitude de 63,4 à 67,8, tout en réduisant l’usage de tokens de 145 736 à 79 117. Cela représente environ 45,7 % de tokens en moins. Sur l’ensemble de 29 évaluations, Qwen annonce une amélioration moyenne de plus de 25 % par rapport à Qwen3.5-Omni-Plus, avec +36,5 points sur WildClawBench-MM, +22,3 points sur AgenticVBench et 69,6 sur UniClawBench. Les scores rapportés restent toutefois ceux de Qwen ; aucune mesure indépendante n’était disponible à la publication.

Prix, limites et disponibilité : l’API d’abord

Le modèle est disponible via QwenCloud, Alibaba Cloud Model Studio et Qwen Studio. La plateforme affiche un prix de 0,15 dollar par million de tokens en entrée et 0,47 dollar par million de tokens en sortie, avec des hits de cache implicites à 0,016 dollar par million de tokens. En comparaison avec Qwen3.5-Omni-Plus, l’équipe dit avoir réduit le coût d’entrée audio de plus de 98 % par heure, le coût audio-vidéo de plus de 93 % par heure et, selon le message publié sur X, le coût vidéo d’environ 89 %.

Les limites d’usage sont aussi détaillées : vidéos jusqu’à 2 heures et 2 Go via URL, audio jusqu’à 3 heures, prise en charge de 113 langues et dialectes pour l’audio, stabilité annoncée jusqu’à 15 images par seconde pour la vidéo, et gestion du stéréo deux canaux comme du FOA spatial quatre canaux via use_multichannel. La disponibilité couvre six régions : Beijing, Singapour, Hong Kong, Tokyo, Francfort et Virginie. À ce stade, l’absence de poids ouverts ferme la porte au self-hosting, ce qui n’empêchera pas les équipes produits de tester l’API là où les intégrations comptent vraiment.

Des plugins ouverts pour brancher la multimodalité aux agents

Pour accompagner le modèle, l’équipe Qwen ouvre aussi deux briques : Qwen-MM-Plugins sous licence Apache-2.0 et Qwen-Live Harness. Le premier se présente comme un moyen de rendre n’importe quel agent harness « multimodal-native » ; chaque capacité s’installe comme un Skill avec, en option, un serveur MCP. L’installateur guidé vise notamment Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.

Les démonstrations publiques s’appuient sur plusieurs modules, dont omni-memory pour bâtir une mémoire audio-visuelle d’une longue vidéo, omni-video2note pour transformer un tutoriel en PDF illustré et omni-chatcut pour la génération de clips musicaux, le commentaire de film ou la traduction vidéo avec préservation de la voix. Le dépôt note toutefois une limite actuelle : la plupart des harnesses ne savent pas encore envoyer l’audio nativement au modèle principal, l’API servant de relais pour l’instant.

En chiffres

  • 1 million de tokens — contexte maximal annoncé par QwenCloud.
  • 63,4 à 67,8 — score OmniVideoBench, selon Qwen.
  • 145 736 à 79 117 tokens — usage sur OmniVideoBench, soit -45,7 %.
  • 0,15 $ / 1M tokens — prix d’entrée affiché par QwenCloud.
  • 6 régions — Beijing, Singapour, Hong Kong, Tokyo, Francfort et Virginie.

À lire