Qwen muscle sa traduction vocale en temps réel

Qwen lance Qwen3.8-LiveTranslate, un modèle de traduction simultanée en temps réel accessible via API. La promesse porte sur moins de latence, plus de contexte et une meilleure gestion des conversations à plusieurs voix.

Qwen a lancé Qwen3.8-LiveTranslate, un modèle de traduction simultanée en temps réel qui écoute la parole, peut prendre en compte des images et renvoie du texte et de l’audio pendant que l’orateur parle encore. Accessible via API sur Alibaba Cloud Model Studio et QwenCloud, le service vise surtout les usages de visioconférence, de support multilingue et d’assistance en réunion. Le changement clé tient à une nouvelle architecture dite Interleave, censée réduire la latence tout en améliorant la fidélité de la traduction.

Moins d’attente, plus de contexte

La traduction simultanée consiste à arbitrer entre vitesse et précision. Attendre davantage donne au modèle plus de contexte ; répondre plus tôt réduit le délai pour la personne qui écoute. Selon Qwen, Qwen3.8-LiveTranslate fait baisser le LAAL, ou Length-Adaptive Average Lagging — une mesure du décalage moyen entre la parole source et la traduction — de 2,8 secondes à 2,3 secondes. Cela représente environ 18 % de retard en moins, selon les chiffres publiés par la société.

Le modèle est présenté comme la version temps réel de Qwen3.8-LiveTranslate-Flash, avec un socle Qwen-Omni et des données multimodales à grande échelle. Qwen met en avant une meilleure fluidité, davantage de concision et une fidélité accrue. Dans ce genre d’outil, chaque demi-seconde compte ; sinon, la réunion finit par ressembler à un numéro de ping-pong un peu fatigué.

Ce que l’API ajoute aux usages professionnels

Trois fonctions ressortent dans la documentation. D’abord, la speaker diarization, qui distingue les locuteurs dans une conversation à plusieurs et aide à garder une voix cohérente pour chacun. Ensuite, l’affichage bilingue synchronisé, avec transcription source et traduction affichées en parallèle. Enfin, la désambiguïsation à long contexte, qui exploite l’historique pour stabiliser noms propres et terminologie au fil d’un échange.

Qwen dit aussi pouvoir gérer 60 langues en entrée et en restituer 29 en audio, les 31 autres restant en texte seul. Les sorties audio couvrent notamment le chinois, l’anglais, l’arabe, l’allemand, le français, l’espagnol, le japonais, le coréen et l’hindi. Des images peuvent compléter l’entrée, avec des indices visuels comme les mouvements des lèvres, les gestes ou du texte à l’écran, utiles dans une salle bruyante ou face à un mot ambigu.

Un service pensé pour les développeurs, pas pour la démonstration

L’accès passe par une API WebSocket en temps réel, avec le modèle qwen3.8-livetranslate-flash-realtime. La documentation indique un débit audio par défaut de 16 kHz en entrée PCM et 24 kHz en sortie, ainsi qu’une voix par défaut nommée Tina. Les équipes peuvent aussi définir des hotwords, c’est-à-dire des termes forcés vers une traduction cible précise, jusqu’à 1 000 selon les recommandations publiées.

Sur le plan tarifaire, Qwen affiche des prix différents selon la région. À Singapour, la grille mentionne 7,50 $ par million de tokens audio en entrée, 0,55 $ pour l’image, 20 $ pour le texte en sortie et 30 $ pour l’audio en sortie. À Pékin, les tarifs sont plus bas, avec 5,653 $, 0,466 $, 14,133 $ et 22,613 $ respectivement, toujours en dollars américains selon la documentation. Le contexte total monte à 53 248 tokens, avec une limite par défaut de 10 requêtes et 100 000 tokens par minute.

Reste un point pratique : certaines fonctions de Model Studio, comme le function calling, les sorties structurées, l’inférence par lots et le fine-tuning, sont indiquées comme non prises en charge à ce stade. Pour les entreprises qui cherchent à industrialiser l’interprétation en direct, l’intérêt est clair. La vraie question, désormais, sera de savoir si la promesse tient dans des réunions réelles, avec accents, bruit de fond et gens qui parlent tous en même temps.

En chiffres

  • 2,3 secondes — LAAL moyen annoncé par Qwen, contre 2,8 secondes avant.
  • 60 langues — langues comprises en entrée par le modèle.
  • 29 langues — langues pouvant être restituées en audio.
  • 53 248 tokens — taille de contexte totale annoncée, dont 49 152 en entrée.
  • 1,54 $ — coût approximatif d’une heure d’entrée et de sortie audio à Singapour, hors texte et images.

À lire