Xiaomi ouvre ses modèles MiMo-V2.6 à l’IA agentique et multimodale
Xiaomi publie MiMo-V2.6-Pro et MiMo-V2.6-Flash, deux modèles omnimodaux open source pensés pour le code, le visuel et l’usage d’outils. La firme revendique des gains de vitesse, des coûts de formation élevés et une disponibilité immédiate sur plusieurs plateformes.
Xiaomi a publié et ouvert le code de MiMo-V2.6, une série de deux modèles omnimodaux conçus pour le code, les tâches visuelles et l’usage d’ordinateur. MiMo-V2.6-Pro vise les performances les plus élevées, tandis que MiMo-V2.6-Flash cherche un meilleur compromis entre coût et efficacité. L’enjeu est clair : faire entrer l’IA agentique dans des usages plus concrets, sans la cantonner aux bancs d’essai.
Deux modèles, deux promesses, et un même terrain de jeu
La gamme repose sur deux variantes nativement omnimodales, ce qui signifie qu’elles peuvent traiter texte, image et vidéo dans un même cadre de fonctionnement. Xiaomi présente Pro comme son modèle le plus capable, et Flash comme l’option plus abordable pour des déploiements plus larges. Sur les benchmarks d’agents, la marque dit que Pro se situe au niveau de Claude Opus 5 et GPT-5.6 Sol sur la plupart des tests, tout en revendiquant un score de 46,32 sur l’Artificial Analysis Intelligence Index v4.3. La comparaison avec Kimi K3 et Qwen3.8 Max sert ici de repère de marché, car l’open source n’avance plus seulement sur la gratuité, mais aussi sur le niveau de sortie.
À ce stade, Xiaomi met surtout en avant la vitesse d’exécution et la baisse de la latence. Pro-UltraSpeed annonce jusqu’à 20 fois plus de sortie à qualité équivalente pour les usages sensibles au temps de réponse. Cette version coûte dix fois plus cher, selon les tarifs publiés, mais elle vise les flux où chaque seconde compte. Une économie d’IA, oui, mais pas encore le buffet à volonté.
Une recette de formation lourde, pensée pour éviter les mauvaises habitudes
Le cœur du projet tient dans une montée en puissance du reinforcement learning sur des tâches vérifiables et complexes. Xiaomi indique que Flash et Pro ont chacun réalisé 30 étapes de RL en moins de six jours, sur environ 750 000 trajectoires, pour un coût estimé à 850 000 dollars et 2,62 millions de dollars respectivement. Les entraînements ont couvert le code, les agents généraux, le visuel et la cybersécurité, avec 1 568 échantillons par mise à jour et des contextes allant jusqu’à un million de tokens. La société dit aussi avoir figé le routeur pour limiter la dérive, puis ajouté évaluation adversariale, détection d’anomalies et contrôles croisés par vérifieurs contre le reward hacking, c’est-à-dire la tendance d’un modèle à “tricher” sur l’objectif au lieu de le résoudre correctement.
Les résultats affichés sont nets, en tout cas selon la note technique. Sur DeepSWE v1.1, les scores passent de 48,8 à 65,68 pour l’une des variantes, et de 58,4 à 72,57 pour l’autre. Dans ce type d’annonce, le détail du protocole compte presque autant que le score final, car il dit quelque chose de la robustesse réelle du système.
De l’écran au robot, Xiaomi pousse plus loin que le simple assistant
MiMo-V2.6 ne se limite pas à écrire du code ou résumer des documents. Xiaomi parle d’un terrain qu’elle appelle « Vibe World », où un prompt en image, vidéo ou texte permet de coordonner des agents pour créer et tester des scènes 3D interactives. Les démonstrations couvrent aussi la création d’assets Blender, la prise en main d’un bras robotique Franka Panda à partir de flux caméra, la fabrication d’interfaces et de présentations, la production de vidéos et même la composition musicale en partition et MIDI.
Des travaux de recherche ont également été mis en avant, avec notamment un cas sur le tri de matériaux pour capter des PFAS, ces substances chimiques persistantes souvent qualifiées de « polluants éternels », ainsi qu’une aide à la formalisation d’un théorème Lean 4 dans plus de 6 000 lignes de code vérifié par le noyau. Le message est assez limpide : Xiaomi veut montrer que son modèle peut sortir du cadre du chatbot poli pour entrer dans des chaînes de travail plus ambitieuses. L’assistant qui fait une présentation, un robot, puis un morceau de musique n’est plus tout à fait un gadget.
Disponibilité immédiate et stratégie d’ouverture
Pro et Flash sont disponibles dans AI Studio, MiMo Code, MiMo Desktop, la plateforme API MiMo de Xiaomi et OpenRouter. MiMo Desktop sort de l’accès anticipé avec les deux modèles intégrés, tandis qu’UltraSpeed est proposé pour des workflows en temps réel. Xiaomi publie aussi le rapport technique, les environnements d’entraînement et le code RL, ce qui place ce lancement dans une logique de reproductibilité plus que de simple démonstration marketing.
Pour le marché, le signal est double. D’un côté, Xiaomi cherche à s’installer parmi les acteurs qui comptent en IA open source, avec une offre qui parle aux développeurs autant qu’aux équipes produit. De l’autre, la société teste une idée plus large : un modèle généraliste peut-il encore progresser vite en combinant open source, agentique et multimodalité, sans exploser les coûts ni le temps de réponse ? La réponse ne tombera pas en une annonce, mais MiMo-V2.6 pose la question de façon assez nette.
Points clés
- Deux modèles omnimodaux : MiMo-V2.6-Pro et MiMo-V2.6-Flash.
- 46,32 sur l’Artificial Analysis Intelligence Index v4.3 pour Pro.
- 30 étapes de RL en moins de six jours, selon Xiaomi.
- Open source et disponible sur OpenRouter, AI Studio et MiMo Desktop.
- MiMo Desktop quitte l’accès anticipé avec les deux modèles.
- Xiaomi cite Claude Opus 5 et GPT-5.6 Sol dans ses comparaisons.
En chiffres
- 750 000 trajectoires — volume d’entraînement annoncé par Xiaomi, septembre 2026.
- 850 000 dollars — coût estimé pour Flash, selon Xiaomi.
- 2,62 millions de dollars — coût estimé pour Pro, selon Xiaomi.
- 1 568 échantillons — par mise à jour, selon la note technique.
- 1 million de tokens — longueur de contexte maximale annoncée.