Gemini 4 Argon prend l’avantage sur les tâches de bureau

Google dévoile Gemini 4 Argon, son nouveau modèle phare, avec de meilleurs scores sur la plupart des tests que GPT-6 Astra et Claude Fable 5.1. L’accès reste limité, tandis que le modèle vise surtout les usages de bureau et les agents.

Google a présenté mercredi Gemini 4 Argon, son nouveau modèle phare, avec des résultats qui le placent devant les modèles d’OpenAI et d’Anthropic sur la plupart des bancs d’essai publiés. La firme promet aussi jusqu’à un million de tokens en sortie, une capacité qui vise les tâches longues et les agents, mais l’accès restera d’abord limité à un cercle fermé avant une diffusion plus large. Autrement dit, le modèle est là, mais pas vraiment sur votre bureau tout de suite.

Un modèle pensé pour le travail de fond

Gemini 4 Argon, modèle d’IA générative de Google orienté vers le raisonnement et les agents, arrive dans un contexte de compétition serrée avec OpenAI et Anthropic. Selon l’annonce du 30 septembre 2026, il bat ou égale ses concurrents sur 13 des 18 tests cités par Google, avec un avantage net sur les tâches de connaissance, d’automatisation et de contexte long.

Le point le plus frappant n’est pas le seul score de référence, mais l’ensemble. Sur Vals Index, Argon obtient 68,9 %, devant GPT-6 Astra à 63,1 % et Claude Fable 5.1 à 65,8 %. Sur AutomationBench, il monte à 51,3 %, soit presque neuf points de plus que Claude Opus 5.5. Et sur GraphWalks, dans la tranche 256k à 1 million de tokens, il affiche 84,2 %, quand GPT-6 Astra tombe à 71,8 %.

Le coding progresse, mais ne domine pas partout

Le discours de Google insiste aussi sur le code, mais les résultats restent plus contrastés. Gemini 4 Argon signe 77,9 % sur DeepSWE v1.1, que Google présente comme un nouveau meilleur score, et 91,9 % sur Vibe Code Bench. En revanche, il termine derrière GPT-6 Astra et Claude Opus 5.5 sur FrontierSWE v2 et Terminal-Bench 4.0 [à vérifier], ce qui rappelle qu’un bon modèle généraliste n’est pas forcément le champion de tous les chantiers.

Cette nuance compte pour les développeurs, car les benchmarks de code ne mesurent pas tous la même chose. Certains évaluent la génération d’un correctif, d’autres la capacité à travailler dans un environnement d’exécution ou à suivre une chaîne d’outils. Google a beau parler d’un modèle taillé pour les agents, le terrain reste moins lisse que les tableaux de score.

Un million de tokens en sortie, et c’est rare

L’autre nouveauté est la plus concrète pour les usages avancés: Gemini 4 Argon peut générer jusqu’à un million de tokens en sortie, contre 64 000 pour les précédentes versions Gemini. Google explique que cette marge doit permettre au modèle de “think deeply and generate hundreds of thousands of tokens in a single trajectory”. En clair, il peut garder une logique plus longue, ce qui intéresse les pipelines d’agents, les gros travaux d’analyse et certains flux de code.

Ce choix technique place Google dans une zone encore peu explorée par ses concurrents, qui ont surtout mis l’accent sur les grands contextes d’entrée. Ici, le moteur ne se contente pas de lire beaucoup. Il peut aussi écrire beaucoup, ce qui change la manière de concevoir une application qui le pilote.

Pourquoi Google pousse autant le volet sécurité

La dimension sécurité occupe une place inhabituelle dans l’annonce. Google dit avoir entraîné Argon pour trouver, valider et corriger des vulnérabilités de manière autonome. Pour les participants au Fairwind Program et les équipes internes, le modèle est même livré sans garde-fous cyber, afin de tester ses capacités au maximum.

Le groupe ajoute que Wiz, racheté 32 milliards de dollars en mars 2026, utilise déjà Argon dans son initiative Scan for Good. Google affirme aussi que le modèle a repéré une faille critique dans un logiciel de santé utilisé par des hôpitaux dans le monde, là où d’autres modèles de pointe n’avaient rien vu. Sur son benchmark interne de découverte de vulnérabilités, Argon atteint 85,8 %, et 70,9 % sur le test de pentest de Wiz.

Accès limité, prix annoncé, stratégie très graduelle

Pour l’instant, Google avance prudemment. L’entreprise dit recueillir les retours des premiers testeurs avant d’élargir l’accès au-delà du Fairwind Program. Quand cela arrivera, les clients API payants et les abonnés AI Ultra passeront en premier, avant les développeurs, les entreprises puis le grand public.

Le tarif de lancement annoncé est de 2 dollars par million de tokens en entrée et 10 dollars par million en sortie, avant un passage à 4 dollars et 20 dollars ensuite. Ce dernier niveau aligne Argon sur le tarif de sortie d’Anthropic pour Opus 5.5. Google veut manifestement frapper fort, mais sans ouvrir grand les vannes d’un coup.

Points clés

  • Gemini 4 Argon a été annoncé le 30 septembre 2026.
  • Google le place devant ses rivaux sur 13 tests sur 18.
  • Argon atteint 84,2 % sur GraphWalks 256k–1M.
  • Le modèle peut produire jusqu’à un million de tokens en sortie.
  • Wiz, racheté 32 milliards de dollars, l’utilise déjà.
  • Google cible d’abord les clients API et AI Ultra.

En chiffres

  • 68,9 % — score de Gemini 4 Argon sur Vals Index, 30 septembre 2026, Google.
  • 51,3 % — score sur AutomationBench, 30 septembre 2026, Google.
  • 77,9 % — score sur DeepSWE v1.1, 30 septembre 2026, Google.
  • 1 million — tokens de sortie maximum annoncés, 30 septembre 2026, Google.
  • 32 milliards de dollars — montant du rachat de Wiz par Google, mars 2026.

À lire