Gemini 4 Argon rapproche Google du trio de tête de l’IA

Google a présenté Gemini 4 Argon, son nouveau modèle phare, avec un tarif d’appel agressif et une fenêtre de sortie de texte portée à un million de tokens. Les premiers tests le placent au contact d’OpenAI et d’Anthropic, sans le propulser nettement devant.

Google a dévoilé Gemini 4 Argon, son nouveau modèle phare, le 1er octobre 2026, avec un objectif clair : recoller aux meilleurs systèmes d’OpenAI et d’Anthropic, sans encore les dépasser franchement. Le modèle peut générer jusqu’à un million de tokens en sortie, une limite que Google présente comme une première dans le secteur, et il entre d’abord en diffusion restreinte. Pour les usages d’assistance avancée, de code ou d’analyse longue, le signal est net : Mountain View revient dans la course, mais pas au sprint.

Un modèle plus ambitieux, mais déployé avec prudence

Gemini 4 Argon est d’abord réservé à un petit groupe de trusted cyber defenders via le programme Fairwind, ainsi qu’aux équipes internes de Google, sans les garde-fous cybersécurité habituels. L’entreprise explique ce choix par une approche progressive, jugée nécessaire pour des capacités de ce niveau. En parallèle, Google participe au programme volontaire du gouvernement américain qui donne à certaines agences un accès anticipé aux nouveaux modèles avant leur publication.

La suite dépendra des retours initiaux. Google indique que ces testeurs alimenteront les mécanismes de sécurité avant une ouverture plus large aux développeurs, aux entreprises puis aux consommateurs, à commencer par les clients API payants et les abonnés Google AI Ultra. Aucune date précise n’a été donnée, seulement un vague “as soon as possible”, ce qui, dans l’IA, peut vouloir dire demain comme un peu plus tard [à vérifier].

Des tarifs bas pour attirer les usages lourds

Le lancement s’accompagne d’un prix promotionnel de 2 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie. Plus tard, le tarif régulier doit grimper à 4 dollars et 20 dollars. Les entrées mises en cache bénéficient d’une réduction de 95 %, soit environ 0,10 dollar par million de tokens selon l’estimation implicite fournie par Google. Le message est simple : Argon veut séduire les clients qui consomment beaucoup, pas seulement ceux qui testent le modèle pour la vitrine.

Cette stratégie s’appuie aussi sur une nouvelle fonction, Long Decode Continuation, qui découpe les réponses longues et les reprend via des requêtes de suivi afin d’éviter les timeouts. Google conserve une fenêtre de contexte d’un million de tokens en entrée. Le modèle accepte du texte, des images, de la vidéo et de l’audio, mais ne produit que du texte. Autrement dit, il écoute large, mais il répond encore à l’ancienne.

Les premiers tests le placent au niveau d’OpenAI, pas au-dessus

Selon Artificial Analysis, Gemini 4 Argon atteint 53 points sur l’Artificial Analysis Intelligence Index au niveau de raisonnement “High”. Cela le met à égalité avec GPT-6 Astra d’OpenAI et Claude Fable 5.1 d’Anthropic, mais toujours derrière Claude Opus 5.5, crédité de 58 points. Par rapport à Gemini 3.1 Pro Preview, Google gagne 23 points. Le rattrapage est réel, même si la tête de course reste chez Anthropic.

La comparaison économique est plus nuancée. À prix promotionnel, une tâche coûte 1,99 dollar pour Argon, contre 3,26 dollars pour GPT-6 Astra. Une fois le tarif normal appliqué, la facture monte à 3,98 dollars, donc un peu au-dessus d’OpenAI. L’avantage de Google vient surtout du prix brut des tokens, pas d’une sobriété spectaculaire : Argon consomme en moyenne 62 000 tokens de sortie par tâche, contre 27 000 pour GPT-6 Astra.

Sur les tâches agentiques, Google progresse enfin

Les modèles Gemini avaient souvent été jugés moins convaincants sur les tâches dites agentiques, c’est-à-dire celles où le système enchaîne plusieurs actions pour atteindre un objectif. Argon corrige en partie le tir. Sur AutomationBench-AA, il prend la première place avec 77,5 %, six points devant Claude Sonnet 5.5. Sur Terminal Bench 4, il atteint 57 %, soit 53 points de mieux que Gemini 3.1 Pro Preview. La marge reste toutefois insuffisante pour dépasser Claude Sonnet 5.5, Claude Opus 5.5 et GPT-6 Astra.

Autre point notable : son taux d’hallucination, c’est-à-dire la propension à inventer une réponse au lieu d’admettre une incertitude, descend à 15 % sur AA-Omniscience selon Artificial Analysis. GPT-6 Astra et GPT-6.1 Sol sont bien plus hauts sur ce test, respectivement à 51 % et 54 %. En revanche, Argon n’atteint que 50 % d’exactitude, ce qui laisse un paradoxe classique des grands modèles : il préfère parfois dire “je ne sais pas” plutôt que raconter n’importe quoi. C’est rassurant, mais pas toujours flatteur.

Google parle de leadership, les classements disent surtout rattrapage

Les résultats internes de Google sont plus flatteurs, Argon arrivant en tête sur la plupart des benchmarks présentés par l’entreprise. Vals AI le place aussi en première position avec 68,9 %, une première pour un modèle Gemini, et le modèle finit dans le top 5 sur 20 des 22 benchmarks testés, avec des points forts en finance, droit, code et sécurité. Attention toutefois, Vals souligne que certains classements peuvent varier selon les modèles comparés et les versions testées.

Sur Arena.ai, où des humains comparent directement les réponses, Argon se distingue surtout en texte. Gemini 4 Argon (High) prend la tête du classement Text Arena avec 1 525 points, devant Claude Opus 4.6 (High). Il arrive aussi premier sur le code, les consignes complexes, les longues requêtes et l’écriture créative, ainsi que sur plusieurs langues, dont l’anglais, le chinois et le russe. En web development, en revanche, il ne fait que huitième. Le tableau d’ensemble est donc plus proche d’un retour sérieux que d’un coup de baguette magique.

Le vrai test commence maintenant : disponibilité, fiabilité en production, et qualité de l’intégration dans l’app Gemini, qui reste moins convaincante que ChatGPT ou Claude pour le travail quotidien. Google a repris du terrain avec Argon. Reste à voir s’il le convertit en avantage durable.

Points clés

  • 1er octobre 2026 : Google dévoile Gemini 4 Argon.
  • 1 million de tokens en sortie, selon Google.
  • 68,9 % sur Vals AI, première place pour Gemini.
  • 1 525 points sur Text Arena, devant Claude Opus 4.6.
  • 1,99 dollar par tâche au tarif promotionnel.
  • Artificial Analysis place Argon à 53 points sur l’index IA.

En chiffres

  • 1 million de tokens — limite de sortie annoncée par Google, octobre 2026.
  • 95 % — réduction sur les tokens mis en cache, selon Google.
  • 68,9 % — score Vals AI, première place pour Gemini 4 Argon.
  • 1 525 points — score Text Arena, classement humain d’Arena.ai.
  • 15 % — taux d’hallucination sur AA-Omniscience, selon Artificial Analysis.

À lire