Gemini 3.8 Live muscle les agents vocaux en temps réel
Google dévoile Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de voix conçus pour dialoguer, raisonner et exécuter des outils sans couper la conversation. La disponibilité passe par le Gemini Live API et Google AI Studio.
Google a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de voix natifs pensés pour les agents vocaux en temps réel. Le premier vise les usages à grande échelle avec un meilleur coût d’exécution, tandis que le second ajoute un raisonnement en plusieurs étapes pendant la conversation. L’enjeu est simple : faire parler une IA sans la transformer en standard téléphonique qui tousse entre deux requêtes.
Deux modèles, deux usages, une même promesse
Gemini 3.8 Live s’adresse d’abord aux déploiements volumineux. Google le présente comme un modèle plus fluide, capable de tenir la conversation tout en s’appuyant sur le contexte visuel et sur l’exécution d’outils en arrière-plan. Gemini 3.8 Live Extended Thinking reprend ces bases, mais vise les tâches plus complexes, celles où l’agent doit raisonner, enchaîner plusieurs actions et parler en même temps.
Les deux modèles sont accessibles dès maintenant dans le Gemini Live API et dans Google AI Studio. Il s’agit de modèles hébergés, sans poids ouverts, donc sans option de self-hosting. Pour les développeurs, Google cible clairement le remplacement des chaînes voix classiques qui empilent reconnaissance vocale, modèle de langage et synthèse vocale.
Ce que les modèles savent faire concrètement
Le Live API met en avant cinq fonctions principales : l’appel asynchrone de fonctions, le contexte visuel, la précision alphanumérique, le support multilingue et les mises à jour incrémentales de contenu. En pratique, cela signifie qu’un agent peut lancer une tâche sans interrompre sa réponse, lire ce que voit l’utilisateur, reconnaître un numéro de dossier ou un code de confirmation, puis passer d’une langue à l’autre sans perdre sa cohérence d’accent.
Extended Thinking pousse plus loin ce principe. Le modèle peut annoncer qu’il vérifie une information, continuer à parler pendant l’exécution d’un processus long, puis restituer l’avancement au fil de l’eau. Dans ses démonstrations, Google montre notamment la conversion d’un croquis et de retours vocaux en composants React, ou encore l’orchestration d’une réservation en plusieurs étapes.
Les chiffres qui comptent pour les développeurs
Sur le terrain des benchmarks, Google met en avant une série de résultats destinés à rassurer les équipes produit. Gemini 3.8 Live Extended Thinking prend la première place du Speech to Speech Quality Index d’Artificial Analysis avec un score de 82,6. Il atteint aussi 68,6 % sur τ-Voice, 35,1 % sur Sierra’s τ-Voice-banking et 97,7 % sur Big Bench Audio. Gemini 3.8 Live arrive deuxième dans le Speech Agent Arena.
Le prix annoncé est de 0,005 dollar par minute pour l’entrée audio et 0,018 dollar par minute pour la sortie audio, sur la base de 3 dollars par million de tokens d’entrée et 12 dollars par million de tokens de sortie. Google précise aussi que l’audio généré porte un filigrane SynthID imperceptible.
Un lancement pensé pour l’entreprise, pas seulement pour la démo
La disponibilité ne se limite pas aux outils maison. Google cite des partenaires d’intégration comme Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents pour gérer le streaming média en temps réel. L’entreprise dit aussi travailler avec Salesforce, Genspark et Lumeris autour de la latence, de la fluidité et de l’appel d’outils.
Dans le même mouvement, Gemini 3.8 Live et Extended Thinking doivent irriguer plusieurs produits Google. Docs Live, Gmail Live et Keep Live prennent en charge la navigation vocale et la rédaction, tandis que Search Live peut guider un dépannage à partir d’une caméra de téléphone. Les utilisateurs de Google AI Pro et Ultra peuvent utiliser ces fonctions dans Docs, et tous les abonnés Google AI y ont accès dans Gmail et Keep. Bref, Google veut que la voix devienne une interface de travail, pas juste un gadget pour allumer la lumière.
Reste un point de vigilance : les modèles sont proposés via des services hébergés, ce qui simplifie l’adoption mais laisse moins de contrôle aux équipes qui veulent tout opérer en interne. Pour les entreprises qui testent des agents vocaux, le sujet ne sera pas seulement la qualité perçue. Ce sera aussi le coût, la latence et la capacité à garder une conversation naturelle quand la machine doit agir vite.
Points clés
- Gemini 3.8 Live vise les déploiements à grande échelle.
- Extended Thinking gère les tâches complexes en plusieurs étapes.
- Artificial Analysis classe Extended Thinking premier avec 82,6.
- Google annonce 97 langues supportées automatiquement.
- Google AI Studio et Gemini Live API accueillent les modèles.
- Google cite Salesforce, Genspark et Lumeris parmi les partenaires.
En chiffres
- 82,6 — score d’Extended Thinking sur le Speech to Speech Quality Index, Artificial Analysis.
- 68,6 % — score sur τ-Voice, selon Google.
- 35,1 % — score sur Sierra’s τ-Voice-banking, selon Google.
- 97,7 % — score sur Big Bench Audio, selon Google.
- 0,005 $/min — audio d’entrée via le Live API, selon Google.