Gemini 3.8 Live mise sur la voix temps réel et les agents

Google lance Gemini 3.8 Live et sa version Extended Thinking, deux modèles audio pour conversations en direct. L’enjeu est double : gagner en fluidité pour les agents vocaux et casser les coûts face à OpenAI.

Google a lancé le 15 septembre 2026 Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio pensés pour des conversations en temps réel. Les deux arrivent dans Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live et Google Workspace. L’entreprise veut séduire à la fois les développeurs et les entreprises avec des agents vocaux plus fluides, capables de répondre en parlant, de traiter des images et d’appeler des outils sans couper la discussion.

Deux modèles, deux logiques d’usage

Gemini 3.8 Live vise la vitesse, l’échelle et le coût. Google le présente comme un modèle adapté aux échanges naturels, avec du raisonnement parallèle et une meilleure prise en compte du contexte visuel. La version Extended Thinking, elle, sert les tâches plus complexes : multi-étapes, arbitrages, coordination d’actions et raisonnement renforcé.

Dans les démonstrations publiées avec l’annonce, le modèle accompagne un nouvel arrivant dans un onboarding, joue aux échecs en quasi temps réel, construit un plan d’affaires et un kit marketing, puis aide au dépannage dans Search Live. Extended Thinking montre aussi des usages plus techniques, comme transformer des croquis en composants React ou piloter des réservations de restaurant via des appels asynchrones. Oui, la machine bavarde en faisant le travail. Presque trop polie.

La voix devient un terrain de compétition très concret

Google revendique des résultats solides sur plusieurs benchmarks. Gemini 3.8 Live Extended Thinking prend la première place du Speech to Speech Quality Index d’Artificial Analysis avec un score de 82,6. Le modèle affiche aussi 68,6 % sur le benchmark τ-Voice pour la complétion de tâches agentiques, et 35,1 % sur le test τ-Voice-banking de Sierra. Google dit encore atteindre 97,7 % sur Big Bench Audio.

Sur le plan économique, l’argument est tout aussi direct. Selon la grille citée par THE DECODER, Google facture 0,005 dollar par minute pour l’entrée audio et 0,018 dollar par minute pour la sortie, contre 0,05 dollar par minute pour GPT-Live-1 chez OpenAI. Une heure de conversation vocale reviendrait ainsi à environ 1,38 dollar chez Google, contre au moins 3 dollars chez OpenAI. Le choix est clair : Google veut gagner sur le prix, même si OpenAI est présenté comme plus naturel grâce au full duplex [à vérifier].

Ce que les développeurs peuvent faire avec Live API

Le Live API de Google sert de colonne vertébrale technique. Il gère des flux continus d’audio, d’images et de texte sur une connexion WebSocket persistante, avec des entrées en PCM 16 bits à 16 kHz, des images JPEG jusqu’à une image par seconde et une sortie audio en PCM 16 bits à 24 kHz. Deux architectures sont prévues : serveur à serveur, ou client à serveur quand le front se connecte directement.

Google cite déjà des plateformes partenaires comme Agora, Fishjam, LiveKit, Pipecat, Vercel et Vision Agents. Salesforce, Genspark et Lumeris sont aussi mentionnés parmi les partenaires intéressés par la latence, la fluidité et l’appel d’outils. Les cas d’usage listés vont des assistants de vente au support client, des jeux interactifs aux lunettes connectées, des véhicules aux outils de traduction et de transcription en direct.

Un déploiement large, mais pas partout au même rythme

Les deux modèles ont commencé à être déployés le 15 septembre 2026. Pour les développeurs, ils sont disponibles dans Gemini API et Google AI Studio. Pour les entreprises, ils entrent en préversion privée dans Gemini Enterprise. Gemini 3.8 Live est accessible à tous dans Search Live, tandis qu’Extended Thinking arrive dans Gemini Live, dans Docs pour les abonnés Google AI Pro et Ultra via Workspace, et dans Gmail et Keep pour tous les abonnés Google AI.

Google annonce aussi que le support client de Gemini Enterprise pour les deux modèles arrive bientôt, tout comme Extended Thinking pour les clients professionnels de Workspace. Tous les audios générés sont marqués avec SynthID, un filigrane imperceptible intégré au son pour aider à détecter les contenus créés par IA. Dans un marché où la voix devient une interface de produit à part entière, cette couche de traçabilité compte presque autant que la qualité audio elle-même.

Points clés

  • 15 septembre 2026 : lancement de Gemini 3.8 Live et Extended Thinking.
  • 82,6 sur Artificial Analysis pour Extended Thinking.
  • 97 langues détectées automatiquement pendant la conversation.
  • 0,005 dollar par minute pour l’audio entrant chez Google.
  • Gemini 3.8 Live arrive dans Search Live pour tous.
  • Google, OpenAI et Salesforce figurent dans les sources.

En chiffres

  • 82,6 — score d’Extended Thinking sur Artificial Analysis, source Google, 2026.
  • 97 langues — bascule détectée automatiquement en conversation, source Google, 2026.
  • 0,005 dollar par minute — audio entrant, grille citée par THE DECODER, 2026.
  • 1,38 dollar — coût d’une heure de conversation, estimation THE DECODER, 2026.
  • 68,6 % — score τ-Voice, benchmark cité par Google, 2026.

À lire