Gemini 4 Argon remet Google dans la course aux modèles de pointe
Google a dévoilé Gemini 4 Argon, un modèle de pointe d’abord réservé à des partenaires cybersécurité. Les scores sont solides, mais son usage réel et son déploiement large restent sous surveillance.
Google a présenté Gemini 4 Argon, son nouveau modèle phare d’IA, avec un déploiement limité à des équipes cybersécurité triées sur le volet. L’entreprise le place au sommet de plusieurs benchmarks internes, mais n’a pas encore fixé de calendrier pour une ouverture plus large. Le lancement compte, car Google sort d’une année compliquée sur l’IA générative et cherche à refermer l’écart avec OpenAI et Anthropic.
Des scores flatteurs, un accès encore très fermé
Selon Google, Gemini 4 Argon domine 13 des 19 tests utilisés en interne face à GPT-6 Astra et Claude Opus 5.5. Le modèle a aussi pris la première place sur le classement texte d’Arena et atteint 77,9 % sur DeepSWE, un test de codage en situation réelle. Sur le papier, la copie est donc propre. Dans la pratique, seuls des partenaires cybersécurité de confiance peuvent l’utiliser pour l’instant, avec une montée en charge annoncée plus tard pour les abonnés payants.
Google décrit aussi Argon comme un modèle pensé pour le raisonnement profond et les tâches longues, dans le logiciel, la connaissance en entreprise, la finance, le droit et la cybersécurité. Le modèle accepte jusqu’à 1 million de tokens en entrée ou sortie, ce qui lui permet de traiter des contextes très étendus. Ce n’est pas le genre de limite qu’on croise au coin de la rue.
La vraie question : le benchmark tient-il la route hors labo ?
C’est là que le dossier se corse. Bloomberg rapporte que des sources internes jugent les performances en codage inégales, malgré de bons résultats de test. D’autres sources proches du projet disent au contraire que Gemini 4 ne montre pas de faiblesse particulière sur les tâches complexes du monde réel. Google conteste l’idée d’un écart majeur, mais le débat autour du « benchmaxxing » reste ouvert [à vérifier]. Le terme désigne une stratégie qui consiste à optimiser surtout les scores de test, parfois au détriment de l’usage concret.
Cette tension n’a rien d’anecdotique pour Google. Gemini alimente déjà Search, Maps, Gmail et Chrome, des produits utilisés par plus d’un milliard de personnes chacun, selon l’entreprise. Le chatbot grand public Gemini et l’AI Mode de Search ont aussi dépassé le milliard d’utilisateurs. Autrement dit, si Argon déçoit en production, l’effet se verra vite. Et personne n’a envie d’un modèle champion du tableau Excel mais bancal au bureau.
Un rattrapage après une année bancale
Le lancement arrive après une séquence difficile. Google avait annoncé Gemini 3.5 Pro à son I/O de mai et promis une sortie en juin, mais le modèle a finalement été abandonné, selon les sources citées par Bloomberg. En parallèle, la société a multiplié les versions Flash, moins ambitieuses, pendant que ses rivaux avançaient leurs propres produits. Gemini 4 Argon devient donc la nouvelle pièce maîtresse d’une stratégie qui doit encore faire ses preuves.
Le coût reste un point sensible. Bloomberg Intelligence évoque jusqu’à 400 millions de dollars pour entraîner un modèle de ce type une seule fois, hors rémunération des chercheurs très qualifiés. Google n’a pas communiqué de prix public définitif pour tous les usages, mais a indiqué que les tarifs API démarrent à 2 dollars / 10 dollars par million de tokens en entrée / sortie pendant la fenêtre promotionnelle, avant de passer à 4 dollars / 20 dollars. Ce niveau de prix dit beaucoup du pari industriel en cours.
Ce que Google essaie vraiment de prouver
Au fond, Gemini 4 Argon sert à montrer que Google peut encore jouer dans le groupe de tête de l’IA générative. L’entreprise veut prouver qu’elle ne se contente pas d’empiler des produits grand public, mais qu’elle peut aussi fournir un modèle de pointe assez solide pour les usages sensibles, notamment la cybersécurité. Le reste dépendra de la tenue en conditions réelles, du rythme d’ouverture et de la manière dont les développeurs s’en empareront.
Pour l’instant, Google a gagné une bataille de crédibilité. La guerre, elle, continue.
En chiffres
- 13 sur 19 — benchmarks internes dominés par Gemini 4 Argon, selon Google.
- 77,9 % — score annoncé sur DeepSWE, test de codage réel.
- 1 million — tokens maximum pris en charge, selon Google.
- 400 millions de dollars — coût de formation estimé par Bloomberg Intelligence pour un modèle de cette taille.
- 2 / 10 dollars — prix API annoncés par million de tokens en entrée / sortie, en phase promotionnelle.