Microsoft muscle la transcription temps réel pour les agents vocaux

Microsoft AI lance MAI-Transcribe-2-Streaming, son premier modèle de transcription en flux continu, avec deux voix synthétiques. L’ensemble vise les agents vocaux, les sous-titres en direct et la dictée, avec une latence qui compte autant que la précision.

Microsoft AI a présenté le 1er octobre 2026 MAI-Transcribe-2-Streaming, son premier modèle de reconnaissance vocale en temps réel, en même temps que MAI-Voice-2.1 et MAI-Voice-2.1-Flash. L’objectif est clair : permettre à des agents vocaux d’écouter, de raisonner et de répondre sans attendre la fin d’une phrase. Selon Microsoft et Artificial Analysis, le modèle se place en tête sur la précision des transcriptions partielles et finales. C’est le genre de détail qui change une expérience utilisateur du tout au tout.

Un modèle pensé pour parler sans couper la conversation

MAI-Transcribe-2-Streaming traite 60 langues avec détection automatique et continue de la langue. Le système produit ses premières hypothèses un peu plus de 100 millisecondes après réception de l’audio, puis les ajuste au fil du contexte avant de figer un texte final. Résultat : un agent peut lancer un outil, préparer une réponse ou afficher des sous-titres pendant que l’interlocuteur parle encore.

Microsoft affirme aussi que ses tests internes affichent des mots deux fois plus vite que chez son concurrent le plus proche sur la dictée et le sous-titrage en direct. Le modèle arrive comme la version streaming du MAI-Transcribe-2 lancé en septembre. Ici, pas de magie, juste de la latence grattée à la milliseconde près.

Des voix synthétiques pour compléter la boucle

Avec MAI-Voice-2.1 et MAI-Voice-2.1-Flash, Microsoft complète sa pile audio pour développeurs. MAI-Voice-2.1 couvre 23 langues et 26 locales, avec une même identité vocale capable de passer d’une langue à l’autre tout en gardant une voix reconnaissable, un accent local et des tournures adaptées. Le modèle est facturé 22 dollars par million de caractères.

MAI-Voice-2.1-Flash reprend la même couverture linguistique, mais vise les usages à gros volume et à faible latence. Microsoft annonce 45 secondes d’audio générées avec une latence de bout en bout de 150 millisecondes, une inférence 55 % plus rapide et un coût environ 60 % inférieur à des modèles comparables. Son prix est fixé à 15 dollars par million de caractères.

Les deux modèles de voix peuvent cloner une identité vocale à partir de quelques secondes d’audio de référence, avec des garde-fous de consentement censés limiter les abus. Le sujet n’est pas anecdotique : plus la voix devient simple à reproduire, plus la question du contrôle grimpe en haut de la pile.

Ce que montrent les mesures d’Artificial Analysis

Artificial Analysis classe MAI-Transcribe-2-Streaming numéro un sur son indice AA-WER Streaming, qui mesure la qualité et la vitesse sur environ 8 heures d’audio mêlant AA-AgentTalk, VoxPopuli et Earnings22. Le modèle affiche 2,5 % de WER, soit le taux d’erreur de mots, avec un texte final obtenu 0,13 seconde après la fin de la parole détectée. Les premières portions de texte atteignent aussi 2,5 % de WER, à 0,12 seconde.

Dans ce classement, Grok Voice Transcribe 2.0 est à 2,7 % de WER et 0,49 seconde, Muse Voice Transcribe à 3,1 % et 0,16 seconde, tandis que Gemini 3.5 Transcribe Live monte à 4,0 %. Cartesia Ink-2 rend bien ses résultats plus vite, mais avec 4,0 % de WER, ce qui le place sur un autre compromis. Microsoft se retrouve donc sur une zone où précision et réactivité se croisent sans trop se marcher dessus.

Une offre pensée pour les développeurs, pas pour les curieux

Microsoft distribue ces modèles via Microsoft Foundry, MAI Playground, Vercel et Azure Voice Live, avec LiveKit annoncé prochainement. Les deux modèles de voix sont aussi accessibles via OpenRouter, tandis que MAI-Transcribe-2-Streaming passe par une API Realtime compatible WebSocket ou par le SDK Azure Speech, selon la documentation développeur. L’ensemble est en public preview, sans SLA annoncé ni open weights.

Pour les équipes qui construisent des agents vocaux, l’intérêt est évident : moins d’attente entre deux tours de parole, une transcription qui se stabilise rapidement et une voix de synthèse plus naturelle. Pour le marché, Microsoft ajoute une pièce de plus à une bataille où la précision ne suffit plus ; il faut aussi parler vite, bien et au bon moment. Sinon, la conversation retombe comme un appel en haut-parleur dans le métro.

Points clés

  • 1er octobre 2026 : lancement de MAI-Transcribe-2-Streaming.
  • 60 langues avec détection automatique et continue.
  • 2,5 % de WER sur AA-WER Streaming.
  • 0,13 seconde pour le texte final, selon Artificial Analysis.
  • 23 langues pour MAI-Voice-2.1.
  • 150 millisecondes de latence annoncées pour MAI-Voice-2.1-Flash.

En chiffres

  • 0,54 dollar par heure audio — prix d’introduction de MAI-Transcribe-2-Streaming, jusqu’à la fin de 2026.
  • 22 dollars par million de caractères — tarif de MAI-Voice-2.1.
  • 15 dollars par million de caractères — tarif de MAI-Voice-2.1-Flash.
  • 55 % — gain d’inférence revendiqué par Microsoft pour MAI-Voice-2.1-Flash.
  • 45 secondes — durée d’audio générée par Flash avec 150 ms de latence de bout en bout.

À lire