Gemini 4 Argon remet Google dans la course des modèles de pointe
Google présente Gemini 4 Argon, son nouveau modèle de frontière, avec un accès d’abord réservé à des testeurs de confiance. Le groupe met en avant ses scores en code, en travail de bureau et en cybersécurité, ainsi qu’une fenêtre de sortie à 1 million de tokens.
Google a dévoilé Gemini 4 Argon, un modèle d’IA de frontière pensé pour tenir de longs raisonnements sur des tâches complexes en ingénierie logicielle, en travail de bureau et en cybersécurité. À ce stade, l’accès reste limité à un petit groupe de défenseurs de confiance via le programme Fairwind, tandis que les clients API payants et les abonnés Google AI Ultra doivent ouvrir la marche plus tard. L’enjeu dépasse le simple effet d’annonce : Google tente de reprendre la main face à OpenAI et Anthropic, avec un modèle qui mise autant sur la puissance que sur le contrôle des usages.
Un modèle de pointe, mais sous clé pour l’instant
Gemini 4 Argon n’est pas encore un produit grand public. Google indique tester le modèle d’abord auprès de cyberdéfenseurs jugés fiables, puis dans le cadre du processus volontaire du gouvernement américain pour l’accès prépublication aux modèles. L’entreprise parle d’un déploiement progressif, sans calendrier précis pour les utilisateurs finaux. En clair, le moteur est prêt à tourner, mais personne ne veut encore lâcher le volant.
Cette prudence s’explique par la nature même d’Argon. Google dit avoir conçu le modèle pour “autonomously find, validate, and patch software vulnerabilities” et pour travailler sans garde-fous cyber dans certains contextes de défense interne ou au sein du programme Fairwind. En parallèle, la société renforce ses protections contre les usages malveillants, notamment les risques de cyber et CBRN, l’injection indirecte de prompt et les comportements d’agents mal alignés.
Des scores solides, surtout sur les tâches longues
Google met en avant des résultats élevés sur plusieurs bancs d’essai. Sur DeepSWE v1.1, un test d’ingénierie logicielle de long horizon, Gemini 4 Argon atteint 77,9 %, contre 74,1 % pour GPT-6 Astra et 74,2 % pour Claude Opus 5.5 selon les chiffres publiés dans les sources. Sur AutomationBench, il monte à 51,3 %, loin devant GPT-6 Astra à 41,4 %. Et sur LVBench, consacré à la compréhension de longues vidéos, Argon affiche 91,7 %.
Dans le détail, les écarts sont plus contrastés qu’un simple communiqué ne le laisserait croire. Argon domine sur certaines mesures de travail agentique, comme le Vals Index, mais il recule sur d’autres tests de code comme FrontierSWE v2 et Terminal-Bench 4.0, où GPT-6 Astra et Claude Opus 5.5 prennent l’avantage. Autrement dit, Google ne présente pas un modèle parfait, plutôt un outil très fort sur les workflows de bureau et de raisonnement prolongé, avec des résultats plus mixtes en codage pur.
Le vrai saut : 1 million de tokens en sortie
La nouveauté la plus frappante tient peut-être au format de sortie. Gemini 4 Argon peut générer jusqu’à 1 million de tokens en une seule trajectoire, contre 64 000 auparavant chez Google. Cette capacité change la manière d’aborder les tâches longues : au lieu de fragmenter une migration de code, une analyse ou une chaîne d’agents, le modèle peut garder davantage de contexte et produire davantage avant de décrocher.
Google présente cette évolution comme une façon de “think deeply” sur des problèmes difficiles. C’est aussi un signal envoyé au marché, car la concurrence avance surtout sur la fenêtre d’entrée, pas toujours sur la longueur de la réponse. Ici, Google tente de prendre un peu d’avance là où l’utilisateur professionnel en sentira l’effet le plus directement : sur les projets lourds, les revues longues et les migrations qui n’aiment pas être coupées au milieu.
En interne, Google s’en sert déjà comme d’un collègue très rapide
Des milliers d’employés de Google utilisent déjà Argon pour le code, la recherche et l’écriture, selon l’entreprise. Google affirme aussi que le modèle a aidé à optimiser des sous-routines en informatique quantique en quelques minutes, ainsi qu’à trouver des économies de mémoire dans ses data centers. Les chiffres avancés parlent de plus de 300 TiB libérés après déploiement, avec un gain projeté total de 500 TiB à 1 PiB.
Le groupe dit également avoir utilisé des agents basés sur Argon pour migrer du C et du C++ vers Rust, notamment sur des bibliothèques internes et sur le noyau Zircon de Fuchsia, fort de plus de 800 000 lignes. Dans le cas de libgav1, Google affirme que l’outil a remplacé 32 000 lignes de SIMD en produisant du Rust sûr et 2,7 fois plus rapide, avec un résultat identique. Ces cas d’usage restent évidemment fournis par Google lui-même, donc [à vérifier] hors de ses propres bancs de mesure.
La tarification veut peser sur le marché autant que les benchmarks
Sur le prix, Google attaque fort. Pendant la période d’introduction, Argon doit coûter 2 dollars par million de tokens en entrée et 10 dollars par million en sortie, avec un tarif de cache réduit de 95 %. Ensuite, la facture passera à 4 dollars et 20 dollars. Selon les comparaisons reprises dans les sources, cela place le modèle sous certains prix d’Anthropic et au niveau de l’offre haute de la concurrence sur la sortie.
Le message est limpide : Google veut à la fois reprendre du terrain sur la qualité perçue et vendre un modèle rentable pour les usages intensifs. Reste à voir si le calendrier suivra. Après l’épisode Gemini 3.5 Pro, annoncé puis jamais livré, le groupe ne peut pas se permettre une nouvelle promesse qui s’évanouit dans les limbes de la feuille de route.
Points clés
- Accès limité d’abord via le programme Fairwind.
- 77,9 % sur DeepSWE v1.1, selon Google.
- 1 million de tokens en sortie, contre 64 000 auparavant.
- Plus de 300 TiB de mémoire libérés en interne.
- Wiz a utilisé Argon via Scan for Good.
- Google vise d’abord les clients API payants et AI Ultra.
En chiffres
- 77,9 % — score annoncé sur DeepSWE v1.1, septembre 2026, Google.
- 1 million — tokens en sortie maximum, annoncé le 30 septembre 2026, Google.
- 300 TiB — mémoire libérée après déploiement interne, selon Google.
- 2 / 10 dollars — prix d’introduction par million de tokens, entrée et sortie.
- 800 000 lignes — ampleur citée pour la migration du noyau Zircon vers Rust.