Gemini 4 Argon pousse les modèles IA vers les longs workflows
Google DeepMind présente Gemini 4 Argon, un modèle orienté développement logiciel, travail juridique et finance, ainsi que cybersécurité. Sa particularité la plus visible : jusqu’à 1 million de tokens en sortie, avec un accès pour l’instant limité.
Google DeepMind a annoncé Gemini 4 Argon, premier modèle de la génération Gemini 4, avec une cible claire : les workflows longs en développement logiciel, en connaissance métier pour le juridique et la finance, et en défense cybersécurité. Sa principale rupture technique tient à sa sortie maximale, portée à 1 million de tokens par réponse, contre 64K sur les précédents modèles Gemini. L’accès reste toutefois limité au Fairwind Program, sans date de lancement public à ce stade.
Un modèle pensé pour travailler longtemps sans couper la conversation
Gemini 4 Argon est un modèle de frontière, c’est-à-dire un système de pointe que Google réserve aux usages les plus exigeants. Dans les faits, il peut produire des réponses très longues, ce qui intéresse les équipes qui veulent faire d’un seul tenant un gros refactoring, un rapport dense ou une analyse juridique. Google ne communique pas encore sa fenêtre de contexte, mais la taille de sortie suffit déjà à le distinguer. Quand on a besoin d’un pavé, mieux vaut qu’il tienne dans la même page.
La société accompagne ce lancement d’un tarif d’introduction de 2 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie, avec un cache à 0,10 dollar par million de tokens d’entrée. Après la période initiale, la grille passe à 4 dollars pour l’entrée et 20 dollars pour la sortie. Logan Kilpatrick a confirmé ces prix de lancement. À ce niveau, la facture dépendra surtout de la longueur des tâches, pas seulement du nombre d’appels API.
Les benchmarks placent Argon en tête sur plusieurs tâches longues
Sur les comparaisons publiées par Google, Gemini 4 Argon prend la tête sur 12 des 18 benchmarks testés et arrive premier ex æquo sur un autre. Le modèle signe notamment 77,9 % sur DeepSWE v1.1, un benchmark de génie logiciel long horizon, contre 74,2 % pour Claude Opus 5.5 et 74,1 % pour GPT-6 Astra. Sur le Vals Index, qui agrège finance, code, juridique et fiscalité, il atteint 68,9 % et se classe premier. Sur AutomationBench, orienté exécution de bout en bout via Zapier, il monte à 51,3 %, loin devant les 42,5 % d’Opus 5.5.
Les résultats sont plus nuancés sur d’autres terrains. Argon reste derrière GPT-6 Astra sur FrontierSWE v2, avec 55,0 % contre 65,5 %, et derrière Claude Opus 5.5 sur Terminal-Bench 4.0, avec 57,4 % contre 66,4 %. Sur OSWorld-2.0, qui mesure l’usage d’un ordinateur par agent, il affiche 69,2 %, en retrait face aux 72,6 % de GPT-6 Astra. Le message est assez lisible : le modèle excelle sur les longues séquences de travail, mais ne domine pas partout.
La cybersécurité devient un terrain d’essai très concret
Google présente aussi Argon comme un modèle capable de trouver, valider et corriger de façon autonome des vulnérabilités logicielles critiques. Dans ce cadre, les défenseurs de confiance et les équipes internes de Google y ont accès sans les garde-fous cyber habituels. Sur CWE-bench v1, dédié à la remédiation de failles, Argon prend la première place ex æquo avec 68 %. Wiz l’utilise déjà via son initiative Scan for Good, et Google affirme que le modèle a repéré une faille critique dans un logiciel de santé employé par des hôpitaux dans le monde, là où des modèles précédents n’avaient rien vu.
Avant une diffusion plus large, Google dit renforcer ses garde-fous sur quatre axes : défense contre les usages malveillants en cybersécurité et contre les risques CBRN, résistance aux attaques par prompt injection indirecte, suivi des écarts entre raisonnement et actions, et exécution dans des bacs à sable isolés pour les cas sensibles. Le terme CBRN renvoie aux risques chimiques, biologiques, radiologiques et nucléaires. Le sujet n’a rien d’abstrait : plus un modèle agit, plus il faut le surveiller.
À l’intérieur de Google, les gains sont déjà mesurables
Google dit que des milliers de salariés utilisent déjà Argon en interne. Les résultats publiés donnent une idée de ce que le modèle cherche à faire gagner. Des agents ont optimisé des espaces mémoire dans des centres de données, libérant plus de 300 TiB, avec une projection entre 500 TiB et 1 PiB. D’autres ont remplacé 32 000 lignes de code SIMD dans le port Rust de libgav1, avec un décodeur 2,7 fois plus rapide à sortie identique. Dans Fuchsia Zircon, les agents migrent aussi des bases C et C++ vers Rust, jusqu’à plus de 800 000 lignes. Google indique enfin qu’Argon a dépassé un algorithme quantique publié de 40 % en quelques minutes.
Le tableau d’ensemble est clair : Google pousse un modèle conçu moins pour répondre vite que pour tenir une tâche longue, coûteuse et sensible. Reste une question de marché assez simple : à ce niveau de prix et de restriction d’accès, Argon sert surtout de vitrine stratégique pour l’instant, pendant que les concurrents gardent leurs propres atouts sur le contexte, les outils ou le code.
Points clés
- Gemini 4 Argon monte à 1 million de tokens en sortie.
- Accès limité au Fairwind Program, sans date publique.
- 77,9 % sur DeepSWE v1.1, selon Google.
- 68,9 % sur le Vals Index, devant Claude Opus 5.5.
- Wiz teste déjà Argon via Scan for Good.
- Google dit l’utiliser en interne à grande échelle.
En chiffres
- 1 million de tokens — sortie maximale par réponse, annoncée par Google DeepMind en 2025.
- 64 000 tokens — plafond de sortie des précédents modèles Gemini cités par Google.
- 2 dollars / 10 dollars — prix d’introduction par million de tokens d’entrée/sortie.
- 300 TiB — capacité mémoire libérée en interne, selon Google.
- 32 000 lignes — code SIMD remplacé dans le port Rust de libgav1.