Google et Alibaba font baisser le coût des voix IA

Google et Alibaba ont chacun dévoilé de nouveaux modèles audio pour la synthèse et la reconnaissance vocale. Les deux groupes misent sur plus de contrôle, plus de langues et des tarifs nettement plus bas.

Google et Alibaba ont tous deux avancé leurs pions sur l’audio IA le 23 septembre 2026, avec des modèles pensés pour générer, reconnaître et faire dialoguer des voix à grande échelle. D’un côté, Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS ; de l’autre, Alibaba présente Qwen-Audio-3.1. Le point commun est clair : rendre la voix artificielle plus souple, plus multilingue et moins chère.

La voix IA devient un produit de masse, pas seulement un gadget de démo

Chez Google, Gemini 3.8 Flash TTS vise les usages créatifs comme les podcasts, les livres audio et les personnages de jeux vidéo, tandis que Flash-Lite TTS cible la génération vocale à moindre coût pour le doublage, les contenus audio et les agents vocaux. Les deux modèles couvrent plus de 100 langues et acceptent des indications de mise en scène ligne par ligne, avec dialogue à deux voix et sons non verbaux comme les rires ou les soupirs.

Alibaba suit une logique proche, mais sur un spectre plus large. Qwen-Audio-3.1 réunit cinq modèles pour la reconnaissance vocale, la synthèse et l’interaction en temps réel. L’ASR améliore la prise en charge multilingue et des dialectes, tout en nettoyant automatiquement les tics de langage et les répétitions. ASR-Next ajoute l’identification de plusieurs locuteurs avec horodatage, ainsi que la détection des émotions, des bruits ambiants et du bruit des machines. Le tout ressemble moins à une simple dictée qu’à une écoute contextuelle, parfois un peu trop attentive pour les bavardages du bureau.

Contrôle créatif, clonage vocal et garde-fous techniques

Google pousse la personnalisation plus loin avec la création de voix à partir de descriptions textuelles, un catalogue de plus de 2 000 voix prédéfinies et un clonage vocal à partir de 30 secondes d’audio. La personne dont la voix est reproduite doit enregistrer une phrase de consentement, et chaque clip généré reçoit un filigrane SynthID inaudible pour signaler l’origine artificielle. Une fonction de “Voice Remixing” est aussi annoncée, mais pas encore disponible.

Du côté d’Alibaba, TTS permet de piloter l’émotion, la vitesse et le style par de simples prompts textuels. TTS-Next combine un modèle de langage et une approche par diffusion pour produire voix, effets sonores et fond audio en un seul passage. Le modèle temps réel va plus loin avec une interaction simultanée où l’IA peut écouter et parler en même temps, couper la parole instantanément et ralentir sa réponse si elle détecte un ton morose, selon Qwen.

Pourquoi les prix attirent autant l’attention

Les tarifs disent souvent plus que les démonstrations. Alibaba annonce des baisses allant jusqu’à 70 % pour TTS, 85 % pour le temps réel et jusqu’à 95 % pour l’ASR. Google affiche, lui, une tarification en dollars par million de tokens : 0,50 dollar pour 1 million de tokens texte en entrée et 9 dollars pour 1 million de tokens audio en sortie avec Flash TTS jusqu’à fin 2026, soit 0,81 dollar pour une heure d’audio généré selon son calcul de 25 tokens audio par seconde.

Chez Flash-Lite TTS, la facture tombe à 6 dollars par million de tokens audio en sortie jusqu’à fin 2026, soit 0,54 dollar l’heure dans les mêmes conditions. À partir du 1er janvier 2027, ces montants doublent. Google précise aussi que les données du forfait gratuit servent à améliorer ses produits, alors que celles du forfait payant n’y contribuent pas.

Pour les développeurs, le mouvement est stratégique : Google et Alibaba ne vendent plus seulement des voix synthétiques, mais des briques capables d’alimenter doublage, assistants, production média et interfaces conversationnelles. Reste la vraie question, très peu glamour mais décisive : qui saura garder une voix naturelle sans faire exploser la facture ni la surveillance des contenus ?

Points clés

  • Google et Alibaba ont annoncé leurs modèles le 23 septembre 2026.
  • Qwen-Audio-3.1 réunit cinq modèles audio chez Alibaba.
  • Google couvre plus de 100 langues avec Flash TTS et Flash-Lite TTS.
  • Alibaba dit réduire ses prix jusqu’à 95 % sur l’ASR.
  • Google facture 0,81 dollar l’heure d’audio avec Flash TTS jusqu’en 2026.
  • Le clonage vocal Google part d’un échantillon de 30 secondes.

En chiffres

  • 5 modèles — dans Qwen-Audio-3.1, annoncé par Alibaba le 23 septembre 2026.
  • Plus de 100 langues — supportées par Gemini 3.8 Flash TTS et Flash-Lite TTS.
  • 2 000 voix — bibliothèque de voix prédéfinies proposée par Google.
  • 30 secondes — durée du sample audio pour le clonage vocal chez Google.
  • 95 % — baisse annoncée par Alibaba sur le prix de l’ASR.

À lire