Gemini Flash s’étoffe avec des modèles plus rapides et moins coûteux
Google ajoute Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber. L’enjeu est simple : faire tourner des agents IA plus vite, avec moins de tokens et un coût inférieur, tout en élargissant les usages.
Google a présenté, le 21 juillet 2026, trois nouveaux modèles Gemini Flash pensés pour les agents IA en production : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash Cyber. L’idée est de réduire la latence, les coûts et le nombre de jetons consommés, trois points qui pèsent directement sur l’adoption des systèmes autonomes. Le groupe mise aussi sur une meilleure fiabilité, avec des usages qui vont du code à l’analyse de documents. Et la facture, elle, ne fait pas semblant de baisser.
Des modèles Flash calibrés pour les usages qui tournent en boucle
Gemini 3.6 Flash devient le modèle “travailleur” de la gamme. Selon Google, il améliore le code, la recherche d’informations et les tâches multimodales, tout en consommant 17 % de jetons de sortie en moins que 3.5 Flash sur l’Artificial Analysis Index. Dans certains tests, comme DeepSWE de Datacurve, la baisse monte jusqu’à 65 % [à vérifier], avec un coût inférieur par jeton produit.
Le positionnement est clair : moins de bavardage, plus d’exécution. Google indique aussi que 3.6 Flash a besoin de moins d’étapes de raisonnement et de moins d’appels d’outils pour mener des workflows multi-étapes. En pratique, cela vise les usages où chaque aller-retour avec le modèle finit par coûter cher en temps et en argent.
Le tarif annoncé reflète cette logique : 1,50 dollar par million de jetons d’entrée et 7,50 dollars par million de jetons de sortie. Pour les entreprises qui industrialisent des agents, la différence peut vite se voir sur la ligne budgétaire.
Flash-Lite monte en vitesse, sans quitter le créneau du bas coût
Gemini 3.5 Flash-Lite vise, lui, les tâches à fort débit : recherche agentique, traitement de documents, flux automatisés et autres petites machines à répétition. Google le présente comme le modèle le plus rapide de la série 3.5, avec 350 jetons de sortie par seconde selon l’Artificial Analysis Index. Une vitesse qui compte quand il faut enchaîner des milliers de requêtes sans transformer l’infrastructure en radiateur.
Son positionnement tarifaire est agressif : 0,30 dollar par million de jetons d’entrée et 2,50 dollars par million de jetons de sortie. Google dit aussi qu’il surpasse nettement 3.1 Flash-Lite sur plusieurs évaluations, notamment Terminal-Bench 2.1, GDM-MRCR v2 et GDPval-AA v2. Dans certains tests, il ferait même mieux que 3 Flash sur SWE-Bench Pro et OSWorld-Verified.
Autre évolution importante : le “computer use”, c’est-à-dire la capacité à agir sur une interface logicielle comme un humain, est désormais intégré comme outil côté client via l’API Gemini et Gemini Enterprise. Cela ouvre la porte à des agents plus autonomes, mais aussi à plus de complexité dans l’orchestration.
Sécurité offensive, accès limité et prudence assumée
Le troisième modèle, Gemini 3.5 Flash Cyber, est plus spécialisé. Il sert à trouver et corriger des vulnérabilités de cybersécurité, via CodeMender, l’agent de sécurité logiciel de Google. D’après l’entreprise, cette version est fine-tunée pour détecter, valider et patcher des failles à moindre coût, avec des performances jugées compétitives sur le benchmark CyberGym.
Mais l’accès sera restreint : le modèle doit être réservé aux gouvernements et à des partenaires de confiance dans le cadre d’un pilote limité. Google avance ici avec prudence, car un modèle capable d’aider les défenseurs peut aussi intéresser les attaquants. La frontière entre protection et usage détourné reste mince, et le communiqué le dit sans détour.
Les nouveaux modèles arrivent dès maintenant dans Gemini API via Google AI Studio et Android Studio. 3.6 Flash est aussi disponible dans Google Antigravity, tandis que 3.6 Flash et 3.5 Flash-Lite sont proposés aux entreprises via Gemini Enterprise Agent Platform. 3.5 Flash-Lite commence également à être déployé dans Google Search.
Ce que Google cherche vraiment à installer
Avec cette salve, Google ne cherche pas seulement à empiler des benchmarks. Le groupe veut surtout verrouiller le segment des agents IA “de production”, là où les entreprises regardent d’abord le coût par tâche, la latence et la stabilité. C’est là que se joue une partie du marché : moins sur le modèle le plus spectaculaire que sur celui qui tient la charge, tous les jours, sans faire grimper la note.
La stratégie est aussi défensive. En multipliant les versions Flash, Google couvre plusieurs points d’entrée : le très bon marché pour les volumes, le plus capable pour les workflows complexes, et le spécialisé pour la cybersécurité. L’entreprise indique enfin que Gemini 3.5 Pro est en test chez des partenaires, tandis qu’un entraînement pour Gemini 4 a déjà commencé.
La course continue, mais elle se déplace. Désormais, la question n’est plus seulement de savoir quel modèle répond le mieux, mais lequel répond assez vite, assez souvent et à un prix supportable.
En chiffres
- 17 % — baisse des jetons de sortie de 3.6 Flash vs 3.5 Flash, Artificial Analysis Index, 2026.
- 350 jetons/s — débit annoncé pour 3.5 Flash-Lite, Artificial Analysis Index, 2026.
- 1,50 $ — million de jetons d’entrée pour 3.6 Flash, annonce Google, 21 juillet 2026.
- 7,50 $ — million de jetons de sortie pour 3.6 Flash, annonce Google, 21 juillet 2026.
- 2,50 $ — million de jetons de sortie pour 3.5 Flash-Lite, annonce Google, 21 juillet 2026.