GPT-Live-1 ouvre l’API voix d’OpenAI au temps réel
OpenAI met GPT-Live-1 dans son API le 10 septembre 2026. Le modèle voix sait écouter et parler en même temps, avec une tarification annoncée à 0,05 dollar la minute pour la couche frontale.
OpenAI a rendu GPT-Live-1 disponible dans son API le 10 septembre 2026, avec une promesse simple à résumer et difficile à tenir à grande échelle : une voix qui écoute et parle en même temps. Le modèle, déjà au cœur de ChatGPT Voice, arrive chez les développeurs pour des usages de réservation, de support client ou d’assistance métier. Le prix annoncé est de 0,05 dollar par minute pour la couche vocale frontale, ce qui place la conversation temps réel dans une zone où chaque seconde compte. Et chaque interruption aussi.
Une voix plus fluide, mais pas un cerveau tout-en-un
GPT-Live-1 est un modèle full-duplex, c’est-à-dire capable de traiter l’écoute et la parole simultanément, sans passer par la chaîne classique reconnaissance vocale, raisonnement, synthèse vocale. OpenAI présente ce choix comme un moyen de réduire la latence, de mieux gérer les interruptions et de préserver le rythme naturel d’un échange. Les tâches plus lourdes, elles, sont déléguées aux modèles et outils associés, derrière la scène.
Dans son annonce, l’entreprise explique que les développeurs peuvent associer GPT-Live-1 à différents backends selon le besoin : un modèle pour les tâches répétitives à grand volume, un autre pour les cas complexes. Le système prompt permet aussi d’ajuster le ton, le débit et le style conversationnel. En clair, on ne demande pas au modèle d’être un clone bavard de son voisin de bureau ; on lui donne un rôle précis.
Ce que les développeurs récupèrent en plus de la voix
OpenAI met en avant plusieurs fonctions pensées pour un usage applicatif. GPT-Live-1 fournit nativement les transcriptions ASR, c’est-à-dire la reconnaissance automatique de la parole, ainsi que le texte des réponses. Il prend aussi en charge le keyword biasing, utile pour mieux reconnaître certains mots, et la compréhension alphanumérique. La gestion du contexte en silence, la tolérance au bruit de fond et la conservation du fil sur de longues sessions font aussi partie du lot.
Le modèle supporte la téléphonie pour des agents vocaux sur appel, que ce soit pour des réservations de restaurant ou du support client. Il n’est pas conçu comme un modèle à tours de parole stricts, mais il intègre la détection de tour pour que les développeurs puissent garder des frontières explicites quand ils le souhaitent. OpenAI montre également un exemple où l’application transmet le contexte à Codex, puis renvoie sa réponse à GPT-Live-1 pendant la session. Le pipeline reste technique, mais l’utilisateur, lui, entend surtout une conversation qui ne trébuche pas à chaque transition.
Des gains annoncés sur les tests, avec quelques écarts selon les benchmarks
OpenAI dit avoir obtenu des résultats supérieurs à ceux de GPT-Realtime-2.1 sur plusieurs évaluations internes et publiques. Sur Full Duplex Bench, le gain annoncé atteint 30 points de pourcentage. Sur le sous-test d’interactivité Full Duplex Bench v1.5, le score rapporté est de 80,10 %, contre 45,4 % pour GPT-Realtime-2.1 et 47,8 % pour GPT-Realtime-2. Le temps de latence au changement de tour tombe à 0,798 seconde, contre 1,41 seconde et 1,63 seconde.
Sur Tau3 Voice Intelligence, qui mesure des tâches de service client dans l’aérien, le commerce de détail et les télécoms, OpenAI annonce un Pass@1 de 86,2 % pour GPT-Live-1, contre 45,7 % et 42,4 % pour les versions précédentes citées. Sur Tau Banking Voice Knowledge, la société dit atteindre 32,0 % sur 97 tâches bancaires, contre 12,4 % et 10,3 %. Enfin, l’Artificial Analysis Conversational Dynamics est donné à 97,3 %, contre 95,7 % et 95,3 %. [à vérifier] sur le périmètre exact de comparaison, car les sources résument parfois des jeux d’évaluation différents.
Les premiers usages montrent où la valeur se crée vraiment
Yelp fait partie des premiers clients mis en avant. Alex Levy, directeur technique de l’entreprise, dit que l’ajout de GPT-Live-1 à Yelp Host et Hatch améliore la prise de tour et la précision, tout en augmentant les taux de traitement des appels pour les réservations et les commandes. Il ajoute : “Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different,”. OpenAI montre d’ailleurs une démonstration où Yelp Host gère bruit de fond, conversations latérales et interruptions pendant une réservation.
Speak, Fin et Cognition décrivent aussi des effets concrets. Andrew Hsu, cofondateur et directeur technique de Speak, dit que GPT-Live-1 a réduit de presque 80 % les interruptions pendant les pauses de réflexion dans ses leçons Live Tutor. Jordan Neil, directeur des opérations de Fin, parle d’un rythme plus proche d’un appel téléphonique naturel. Walden Yan, cofondateur et directeur produit de Cognition, décrit un usage autour de Devin pour discuter d’une idée, tester une approche ou déléguer du travail en étant loin du clavier. Cela reste du discours produit, mais le message est net : la valeur se joue sur la continuité de l’échange, pas seulement sur la voix elle-même.
Un modèle, des voix, et quelques choix à faire
OpenAI dit élargir la palette de voix disponibles, avec davantage d’accents, de dialectes et de langues. Un lot de douze nouvelles voix est mentionné dans la source du 10 septembre 2026. Les accès à la voix personnalisée passent par le service commercial, avec une vérification d’éligibilité. Les entreprises qui veulent un assistant qui sonne “comme il faut” devront donc passer par la case contact, ce qui n’a rien d’étonnant dans un produit encore très cadré.
L’entreprise rappelle aussi que SynthID, son tatouage numérique pour l’audio, a été ajouté le 31 juillet 2026 aux contenus générés par ChatGPT Voice et l’API quand le support est disponible. GPT-Live-1 s’inscrit donc dans une montée en gamme du temps réel chez OpenAI, entre interface conversationnelle, usage métier et agents vocaux téléphoniques. Pour les développeurs, le vrai sujet n’est pas de faire parler une machine. C’est de la faire parler au bon moment, sans casser la conversation.
Points clés
- GPT-Live-1 arrive dans l’API OpenAI le 10 septembre 2026.
- Le prix annoncé est de 0,05 dollar par minute.
- OpenAI dit mieux gérer interruptions et bruit de fond.
- Yelp, Speak, Fin et Cognition figurent parmi les premiers usages.
- OpenAI évoque douze nouvelles voix et plus de langues.
- GPT-Realtime-2.1 sert de comparaison dans plusieurs benchmarks.
En chiffres
- 0,05 dollar par minute — couche vocale frontale, API OpenAI, 10 septembre 2026.
- 80,10 % — Full Duplex Bench v1.5 Interactivity, OpenAI, comparaison avec GPT-Realtime-2.1 à 45,4 %.
- 0,798 seconde — latence de prise de tour, Full Duplex Bench v1, OpenAI.
- 86,2 % — Tau3 Voice Intelligence, OpenAI, tâches de service client.
- 12 voix — nouvelles voix mentionnées dans l’annonce du 10 septembre 2026.