Gemini 3.8 Live mise sur la voix en temps réel
Google présente Gemini 3.8 Live et sa version Extended Thinking, deux modèles pensés pour les conversations vocales avec vision, raisonnement et actions en arrière-plan. Le déploiement démarre dans l’API, Search Live et certains usages Workspace.
Google a dévoilé le 15 septembre Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles conçus pour les conversations vocales en temps réel. L’idée est simple à formuler, mais plus délicate à exécuter : parler avec un utilisateur tout en lançant des tâches, des appels d’API et du raisonnement en arrière-plan. Pour les agents vocaux, cela change la donne car la latence et les interruptions pèsent encore lourd dans l’expérience.
Une conversation qui continue pendant le travail
Gemini 3.8 Live peut accuser réception d’une demande, poursuivre l’échange, puis récupérer le résultat d’une action menée en parallèle. Google présente donc un modèle qui ne bloque pas la discussion pendant qu’il traite une requête. La version Extended Thinking pousse plus loin cette logique : elle peut raisonner tout en parlant, puis signaler l’avancement d’une tâche en plusieurs étapes. Une manière de rendre les assistants vocaux moins mécaniques. Enfin, ils ont moins d’excuse pour vous laisser en plan au milieu d’une phrase.
Cette approche vise surtout les usages où l’agent doit enchaîner plusieurs actions sans casser le fil de la conversation. Google cite des scénarios d’assistance à la prise en main d’un poste de travail et d’interaction autour d’un échiquier filmé en direct. Le modèle traite aussi des entrées visuelles en quasi-temps réel, afin de croiser ce que dit l’utilisateur et ce qu’il montre à la caméra. Dans ce contexte, la voix seule ne suffit plus : l’interface doit comprendre le geste, l’image et le dialogue.
Deux modèles, deux priorités
La différence entre les deux versions tient surtout à leur ambition. Gemini 3.8 Live cible les conversations rapides et le passage à l’échelle, avec une prise en compte du contexte visuel. Gemini 3.8 Live Extended Thinking ajoute des capacités de raisonnement plus poussées pour les tâches à plusieurs étapes. Google positionne donc le premier comme une brique plus orientée coût et volume, et le second comme une option plus sophistiquée pour les scénarios complexes.
Le modèle standard prend en charge 97 langues et peut basculer automatiquement de l’une à l’autre au cours d’une même conversation, selon Google. C’est utile pour les services clients, les assistants internes ou les interfaces publiques qui doivent jongler avec plusieurs marchés. La société met aussi en avant plusieurs évaluations externes : 82,6 points sur le Speech to Speech Quality Index d’Artificial Analysis pour la version Live Extended Thinking, 68,6 % sur τ-Voice, 35,1 % sur τ-Voice-banking de Sierra et 97,7 % sur Big Bench Audio. Gemini 3.8 Live se classe, lui, deuxième du Speech Agent Arena d’Artificial Analysis.
Un lancement pensé pour les développeurs et les produits Google
Le déploiement commence dans le Gemini API et Google AI Studio pour les développeurs. Une disponibilité en préversion privée est aussi annoncée pour Gemini Enterprise, tandis que le modèle arrive dans Search Live. De son côté, Live Extended Thinking est accessible via le Gemini API et Google AI Studio, mais aussi dans Gemini Live et certaines fonctions de Workspace, notamment Docs, Gmail et Keep, selon les abonnements. Google précise enfin que les contenus audio générés par ses produits d’IA sont marqués avec SynthID, un filigrane imperceptible destiné à permettre leur détection.
Sur le plan tarifaire, la version Live est facturée à l’usage : 0,005 $ par minute pour l’entrée audio et 0,018 $ par minute pour la sortie audio. La déclinaison Extended Thinking entraîne des coûts supplémentaires liés notamment aux tokens de raisonnement, ainsi qu’aux autres types d’entrées comme la vidéo ou les documents. Google s’appuie aussi sur plusieurs partenaires spécialisés dans les infrastructures audio temps réel, parmi lesquels Vercel, LiveKit, Agora, Pipecat et LangChain. Côté marché, le message est clair : la voix devient une interface sérieuse, pas juste une option sympathique dans un chatbot.
Points clés
- Dévoilé le 15 septembre par Google.
- 97 langues prises en charge automatiquement.
- 82,6 points sur le Speech to Speech Quality Index.
- Gemini 3.8 Live arrive dans Search Live.
- Google cite Vercel, LiveKit et Agora.
En chiffres
- 0,005 $ par minute — entrée audio facturée par Google.
- 0,018 $ par minute — sortie audio facturée par Google.
- 97 langues — prise en charge annoncée par Google.
- 82,6 points — score du modèle Live Extended Thinking sur Artificial Analysis.
- 15 septembre — date de l’annonce citée par la source.