Xiaomi, DeepSeek et Google accélèrent sur les modèles IA spécialisés

Xiaomi, DeepSeek, Google et plusieurs laboratoires poussent de nouveaux modèles capables de raisonner, parler ou servir des agents. Les gains portent autant sur les performances que sur le coût et la mémoire, avec des impacts directs pour les usages professionnels.

Les dernières annonces de Xiaomi, DeepSeek, Google et plusieurs équipes de recherche montrent un même mouvement : les modèles d’IA deviennent plus spécialisés, plus rapides et souvent moins chers à exploiter. En 2025, la bataille ne se joue plus seulement sur la taille brute, mais sur la capacité à raisonner, parler, appeler des outils ou tenir de longs contextes sans faire exploser la facture. Dans le cyber, dans la voix ou dans les agents de recherche, ces progrès changent déjà la donne pour les développeurs comme pour les défenseurs.

Des modèles plus sobres, mais pas moins ambitieux

Xiaomi a pris la tête des modèles open weights sur plusieurs classements avec MiMo-V2.6-Pro-RL et MiMo-V2.6-Flash, deux modèles publiés avec plus de 7 000 environnements d’apprentissage par renforcement et le code associé. Le groupe dit avoir entraîné MiMo-V2.6-Pro sur 27 trillions de tokens de texte, puis 3 trillions de tokens multimodaux, avant une phase de renforcement centrée à 68 % sur le code. Le tout sous licence MIT, avec des API facturées à partir de 0,14 dollar par million de tokens en entrée pour la version Flash.

DeepSeek, de son côté, pousse l’optimisation mémoire avec DeepSeek-V4.1-Flash. Le modèle conserve une fenêtre de contexte d’un million de tokens, mais réduit fortement le coût du cache : 890 octets par token, selon le papier technique, soit environ quatre fois moins que DeepSeek-V4-Flash. Résultat, l’exécution reste rapide et moins coûteuse pour les agents qui enchaînent lectures, appels d’outils et retours de contexte. Le sujet n’est pas glamour, mais il fait baisser la note, ce qui aide toujours à convaincre un DAF.

La voix devient un terrain sérieux pour les agents

Google a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles speech-to-speech pensés pour des conversations en temps réel. Le premier vise l’échelle et le coût ; le second ajoute une couche de raisonnement pour les tâches plus complexes. Les deux prennent des entrées image et vidéo, supportent 97 langues et peuvent exécuter des outils en arrière-plan pendant la conversation. Google les a déjà intégrés à Search Live, au Gemini app et à Workspace, avec SynthID pour marquer les contenus audio générés.

Le changement est important pour les interfaces où taper au clavier reste pénible, notamment sur mobile ou dans l’automobile. Les modèles vocaux suppriment aussi une partie de la latence des architectures classiques, où l’on convertit la parole en texte avant de la renvoyer vers un modèle de raisonnement. Pour autant, la simplicité apparente cache une exigence forte sur la qualité de l’oralisation et de la compréhension contextuelle.

Quand le cyber devient un argument de benchmark

Anthropic a publié une analyse encourageante sur les capacités cyber de GLM-5.3, un modèle open weight qui s’approche, sur certains tests, de Claude Mythos. Sur une sous-partie d’ExploitBench, GLM-5.3 a réussi 12 % des tentatives d’exploitation contre 14 % pour Mythos, avec un nombre de tokens comparable. L’écart est plus large dans le rapport du créateur du modèle sur le benchmark complet, avec 54,4 % de réussite contre 78,0 % [à vérifier].

Le rapport souligne aussi un point plus concret : Anthropic dit qu’il a suffi de 20,40 dollars de tokens sur GLM-5.3-Flash pour trouver une faille récemment divulguée dans Google Chrome. Dans ce contexte, la baisse du coût d’exploration des vulnérabilités intéresse autant les attaquants que les défenseurs. Les auteurs rappellent toutefois que des garde-fous affaiblis rendent ces modèles encore plus utiles des deux côtés du miroir.

Des agents qui apprennent à vérifier ce qu’ils écrivent

À Beijing, des chercheurs de la Beijing Academy of Artificial Intelligence ont présenté AREX, un agent de recherche qui améliore ses réponses par cycles successifs. Le système rassemble des preuves, résume son état de travail, puis lance de nouvelles requêtes ciblées sur les points encore fragiles. Cette logique a permis à deux modèles Qwen3.5 fine-tunés de mieux faire que des versions non adaptées, sur six benchmarks agentiques.

Sur BrowseComp, le système fondé sur Qwen3.5-122B-A10B atteint 82,5 % de précision, contre 85,9 % pour un concurrent basé sur Gemini Pro 3.1. Sur WideSearch-en, il monte à 82,0 % de F1, devant Kimi-K2.6 à 80,8 %. La leçon est assez simple : dans les agents de recherche, tout ne se vaut pas. Certaines étapes pèsent beaucoup plus que d’autres, et les bonnes boucles de vérification valent parfois mieux qu’un prompt plus long.

Au fond, ces annonces disent la même chose : l’IA utile n’est plus seulement celle qui parle bien, mais celle qui coûte moins cher à faire tourner, vérifie mieux ses réponses et s’insère dans des usages concrets. Les modèles deviennent plus sobres, plus spécialisés et plus proches de la production. Reste à voir lesquels tiendront le rythme quand l’engouement médiatique sera retombé, ce qui, dans ce secteur, finit toujours par arriver.

Points clés

  • Xiaomi publie MiMo-V2.6 avec code et environnements RL.
  • DeepSeek-V4.1-Flash réduit le cache à 890 octets par token.
  • Gemini 3.8 Live supporte 97 langues et la vidéo.
  • AREX atteint 82,5 % sur BrowseComp selon l’étude.
  • Anthropic cite 20,40 dollars pour trouver une faille Chrome.
  • GLM-5.3 se rapproche de Claude Mythos sur certains tests.

En chiffres

  • 1 million de tokens — contexte maximal de MiMo-V2.6 et DeepSeek-V4.1-Flash.
  • 7 000+ — environnements RL publiés par Xiaomi.
  • 890 octets/token — cache plein d’entrée de DeepSeek-V4.1-Flash.
  • 82,5 % — score d’AREX sur BrowseComp.
  • 20,40 dollars — coût cité par Anthropic pour une faille Chrome.

À lire