Gradium améliore sa synthèse vocale face aux numéros et emails

Gradium a rendu par défaut son nouveau modèle de synthèse vocale dans son API et Studio, avec 81,0 % de réussite sur un jeu de test difficile. L’enjeu est concret : mieux lire les numéros, codes et emails dans les appels automatisés.

Gradium a déployé le 31 août 2026 un nouveau modèle de text-to-speech par défaut dans son API et dans Studio, sans migration pour les équipes déjà clientes. L’entreprise dit viser les cas où les agents vocaux trébuchent encore le plus souvent : numéros de commande, chiffres de rappel, adresses email ou codes alphanumériques. Sur ce terrain, la qualité de lecture compte autant que la vitesse, car un seul chiffre avalé peut faire rater l’appel. Et, dans ce domaine, les robots n’ont pas encore tous les numéros dans le bon ordre.

Lire un numéro correctement vaut parfois plus qu’un beau timbre de voix

Le nouveau modèle de Gradium se distingue d’abord par son score sur les « hard cases », ces phrases volontairement piégeuses où un mot manquant ou une lettre déformée suffit à faire échouer la tâche. L’entreprise annonce 81,0 % de réussite, mesurée par des évaluateurs humains, sur un corpus de 500 phrases réparties sur cinq langues : anglais, allemand, français, espagnol et portugais. Cette précision vise surtout les usages d’assistance téléphonique et d’agents vocaux, où l’utilisateur attend une lecture nette, pas un effet de style.

La comparaison fournie par Gradium place son modèle devant Cartesia Sonic 3.6, à 75,1 %, ElevenLabs v3 Conversational, à 65,4 %, Fish Audio S2.1 Pro, à 49,5 %, et Inworld TTS 1.5 Max, à 46,5 %. Le protocole s’appuie sur un jeu de test publié sur Hugging Face sous licence CC BY 4.0, avec 100 items répartis en 10 critères. Parmi eux, on trouve les acronymes, les suites alphanumériques, les dates, les nombres réguliers, les grands nombres, les nombres flottants et les emails.

Une latence courte, mais pas seulement une course au chronomètre

Gradium met aussi en avant un temps de première audio de 216 millisecondes au 50e percentile sur Coval, soit 170 millisecondes de moins que le modèle remplacé. La dispersion annoncée est faible, avec un écart interquartile de 30 millisecondes sur 480 exécutions, ce qui compte dans une conversation automatisée : l’important n’est pas seulement d’être rapide une fois, mais de l’être de façon régulière. À ce jeu, la médiane ne raconte pas tout.

Le tableau transmis par l’entreprise nuance d’ailleurs le discours de vitesse pure. Inworld TTS 2 affiche une médiane plus basse, à 166 millisecondes, tandis que Fish Audio S2.1 Pro et ElevenLabs v3 Conversational sont plus lents, avec respectivement 291 et 329 millisecondes. Gradium ne revendique donc pas le chrono absolu, mais un compromis entre faible latence et fiabilité sur les séquences délicates. Pour les fournisseurs d’assistants vocaux, c’est souvent là que se joue la différence entre un système utile et un système qui vous demande de répéter votre numéro de dossier trois fois.

Ce que change le passage en défaut dans l’API

Le fait que le modèle soit activé par défaut dans l’API et Studio, sans changement pour les voix existantes ni pour les clones personnalisés, compte plus qu’un simple effet d’annonce. Cela abaisse la barrière d’adoption pour les équipes qui testent déjà la synthèse vocale dans des produits de support client, de prise de rendez-vous ou d’assistance interne. En pratique, Gradium pousse son nouveau modèle directement dans la chaîne de production, au lieu de le laisser dans un coin du laboratoire.

La société dit aussi accepter les retours via Discord et offrir 1 million de crédits pour des rapports complets sur les échecs observés dans les cas difficiles. Le jeu de données est public, mais le benchmark reste piloté par le fournisseur [à vérifier] ; il faut donc lire les scores comme une photographie utile, pas comme un verdict définitif. Pour les acheteurs d’outils vocaux, le signal est clair : la bataille se déplace de la simple voix « naturelle » vers la capacité à prononcer sans faute ce qui doit l’être, surtout quand il y a un code au bout du fil.

Points clés

  • Gradium a rendu son modèle par défaut le 31 août 2026.
  • 81,0 % de réussite sur 500 phrases difficiles, selon Gradium.
  • Le test couvre cinq langues : EN, DE, FR, ES, PT.
  • 216 ms P50 de première audio sur Coval.
  • Cartesia Sonic 3.6 atteint 75,1 % sur le même ensemble.
  • Le jeu de test est publié sur Hugging Face sous CC BY 4.0.

En chiffres

  • 500 phrases — corpus de test difficile, cinq langues, Gradium, août 2026.
  • 81,0 % — taux de réussite humain annoncé par Gradium.
  • 216 ms — temps de première audio médian P50 sur Coval.
  • 30 ms — largeur interquartile annoncée sur 480 runs.
  • 1 million de crédits — récompense proposée pour des rapports d’échec complets.

À lire