OpenAI et Microsoft accélèrent sur les agents et la voix

OpenAI prépare dots, des agents intégrés à ChatGPT capables de continuer une tâche en arrière-plan. Microsoft, de son côté, dévoile de nouveaux modèles vocaux pour la transcription et la synthèse, avec des usages très concrets pour les assistants.

OpenAI et Microsoft ont présenté, le 2 octobre 2026, deux avancées qui poussent l’IA vers un usage plus autonome et plus naturel à l’oral. D’un côté, dots doit prolonger ChatGPT avec des agents capables de travailler après la fermeture du chatbot. De l’autre, Microsoft sort de nouveaux modèles de transcription et de synthèse vocale pensés pour les assistants vocaux, avec des latences très courtes et des coûts annoncés à la baisse. Dans les deux cas, la promesse est la même : faire gagner du temps, sans faire disparaître la vigilance humaine. Le robot, lui, n’a toujours pas appris à lever la main avant de parler.

OpenAI pousse ChatGPT vers le collègue virtuel

Avec dots, OpenAI présente des agents IA qui restent actifs en arrière-plan et poursuivent un objectif même quand l’utilisateur quitte ChatGPT. La fonctionnalité, intégrée à ChatGPT, s’appuie selon la source sur GPT-6 Astra et dispose de son propre ordinateur dans le cloud, de son navigateur et d’un accès à plus de 4 000 applications. L’idée n’est plus seulement de répondre à une requête, mais d’exécuter une suite d’actions sous supervision.

OpenAI décrit dots comme un prolongement de l’utilisateur, mais aussi comme un collègue virtuel. Ces agents apprennent des interactions, peuvent être utilisés dans Teams et Slack, et demandent une validation avant toute action finale. L’entreprise donne un exemple parlant : un agent qui surveille les retours d’une application, prépare des correctifs ou de nouvelles fonctions, puis les teste avant soumission. Les usages visés touchent donc autant les développeurs que les équipes produit ou support.

Une arrivée utile, mais pas tout de suite pour tout le monde

La disponibilité reste limitée. Selon la source, dots n’est proposé qu’avec les abonnements Pro et Business Premium, et n’est pas accessible pour l’instant dans l’Espace économique européen, en Suisse ni au Royaume-Uni. Pour la France, cela signifie une attente supplémentaire, ou un contournement technique comme un VPN [à vérifier selon les conditions d’accès locales]. OpenAI avance donc vite sur l’agentique, mais garde encore les portes fermées sur une partie de ses marchés les plus régulés.

Cette stratégie s’inscrit dans une tendance plus large : les agents IA ne se contentent plus de rédiger ou résumer, ils planifient et exécutent. Reste la question de fond, qui revient à chaque saut d’autonomie : comment savoir exactement ce que fait l’IA, et comment l’arrêter au bon moment ? La réponse technique n’est pas encore aussi simple que le slogan.

Microsoft mise sur la voix, avec des modèles très rapides

En parallèle, Microsoft AI a lancé MAI-Transcribe-2-Streaming, un modèle de transcription en temps réel qui prend en charge 60 langues et fournit ses premiers résultats partiels en un peu plus de 100 millisecondes. Microsoft affirme qu’il se classe premier en précision sur Artificial Analysis. Le tarif promotionnel annoncé est de 0,54 dollar par heure d’audio jusqu’à la fin de l’année 2026.

L’éditeur a aussi présenté deux modèles de synthèse vocale, dont MAI-Voice-2.1, capable de parler 23 langues dans la même voix, avec un accent natif dans chacune. La variante Flash descend à 150 millisecondes de latence et coûte 15 dollars par million de caractères, contre 22 dollars pour la version standard selon Microsoft. Ces modèles peuvent aussi cloner une voix à partir de quelques secondes d’audio de référence, avec des garde-fous intégrés pour limiter les abus.

La voix devient un terrain de concurrence plus sérieux

Les deux annonces montrent que la compétition ne se joue plus seulement sur la qualité d’un chatbot. Elle glisse vers l’exécution d’actions, la coordination avec des outils métiers et, côté Microsoft, la conversation en temps réel. Les modèles vocaux de l’éditeur sont disponibles via Microsoft Foundry, MAI Playground et OpenRouter, ce qui facilite leur adoption par des développeurs et des intégrateurs.

Un test cité par Microsoft donne aussi une indication sur le réalisme atteint : environ la moitié des 4 000 participants pensaient que les voix provenaient d’une vraie personne. Le niveau de fluidité progresse donc, mais il s’accompagne d’un sujet qui reste brûlant : le clonage vocal est pratique pour les assistants, et redoutable quand il sort du cadre prévu. Pour les entreprises, cela ouvre des usages concrets ; pour les régulateurs, une nouvelle série de nuits blanches.

Points clés

  • OpenAI a présenté dots le 2 octobre 2026.
  • Dots fonctionne avec ChatGPT, Teams et Slack.
  • Microsoft annonce 60 langues pour MAI-Transcribe-2-Streaming.
  • MAI-Voice-2.1 gère 23 langues dans une même voix.
  • Dots n’est pas disponible dans l’EEE, la Suisse ni le Royaume-Uni.
  • Microsoft cite Artificial Analysis pour la précision de son transcripteur.

En chiffres

  • 4 000 applications — accès annoncé pour dots, selon OpenAI.
  • 100 millisecondes — premier résultat partiel de MAI-Transcribe-2-Streaming.
  • 0,54 dollar/heure — prix promotionnel de la transcription, jusqu’à fin 2026.
  • 150 millisecondes — latence annoncée pour MAI-Voice-2.1-Flash.
  • 4 000 participants — test de perception vocale cité par Microsoft.

À lire