Saaras V4 couvre 22 langues indiennes et l’anglais en un seul modèle

Sarvam AI lance Saaras V4, un modèle de reconnaissance vocale pour les 22 langues indiennes officielles et l’anglais. La mise à jour ajoute des accents anglais globaux, cinq modes de sortie et une tarification API à partir de 30 roupies de l’heure.

Sarvam AI a publié Saaras V4, une nouvelle génération de son modèle de reconnaissance vocale capable de traiter les 22 langues indiennes officielles ainsi que l’anglais, désormais avec des accents internationaux. Disponible via API dès maintenant, le service vise les usages de transcription, de traduction et de transcription en temps réel, avec un positionnement clair sur les langues indiciennes, souvent mal servies par les outils généralistes. Le tout sans magie noire, mais avec un modèle bien plus ambitieux qu’une simple couche de post-traitement.

Un modèle pensé pour plusieurs langues, pas pour faire semblant

Saaras V4 repose sur une architecture encodeur-décodeur. Un encodeur audio transforme la forme d’onde en représentations exploitables, puis un adaptateur réduit la longueur de la séquence pour l’intégrer à l’espace d’embedding du modèle de langage. Ce choix permet de gérer de longs enregistrements sans déborder du budget de contexte du décodeur.

Au cœur du système, Sarvam place Sarvam-3B, un modèle de langage hybride de 3 milliards de paramètres, entraîné depuis zéro en interne. Il lit les signaux audio avec une consigne textuelle, puis génère la transcription de manière autoregressive. En clair, le modèle produit les mots un à un, en s’appuyant à chaque étape sur ce qu’il vient de sortir.

Selon Sarvam, cette architecture lui permet de couvrir les 22 langues indiennes tout en ajoutant l’anglais, y compris des accents mondiaux. L’entreprise affirme aussi obtenir des résultats de pointe sur l’ensemble de ces langues, mais les chiffres restent fournis par l’éditeur, sans reproduction indépendante publiée à ce stade [à vérifier].

Cinq sorties depuis une seule API

L’intérêt de Saaras V4 tient aussi à ses modes de sortie. Une même piste audio peut être traitée en transcribe pour obtenir une transcription native normalisée, en verbatim pour conserver chaque mot tel qu’il est prononcé, en codemix pour garder les mots anglais en anglais, en translit pour une translittération latine complète, ou en translate pour une traduction anglaise avec nombres normalisés.

Ce choix limite les étapes intermédiaires, souvent sources d’erreurs. Sarvam soutient qu’en traitant ces variantes directement dans le modèle, on évite une chaîne de post-traitement qui peut dégrader le résultat final. C’est le genre de détail qui ne saute pas aux oreilles, mais qui finit par coûter cher quand on traite des volumes.

Le modèle ajoute aussi un mécanisme de keyterm prompting, réservé à saaras:v4. L’utilisateur peut envoyer une liste JSON de termes clés, jusqu’à 50 entrées de 64 caractères chacune, pour orienter la reconnaissance vers des noms propres, des marques ou du vocabulaire métier. Ces termes n’imposent pas le résultat, ils le biaisent seulement. Pour garder un nom comme PhonePe en alphabet latin, Sarvam recommande d’utiliser le mode codemix.

Des performances annoncées en hausse, mais encore à confirmer

Sarvam met en avant plusieurs mesures maison. Sur l’anglais, l’entreprise dit avoir évalué sept jeux de données, dont six issus du classement Open ASR Leaderboard de Hugging Face — AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech et VoxPopuli — plus Svarah, un jeu de données à accent indien d’AI4Bharat. Saaras V4 afficherait la moyenne de WER la plus basse parmi les modèles comparés par Sarvam.

Sur les langues indiennes, la société dit s’appuyer sur Vistaar pour dix langues, avec deux métriques : la WER, qui mesure le taux d’erreur mot à mot, et la LLM-WER, une variante intégrant une vérification sémantique afin de distinguer les fautes de sens des simples écarts d’orthographe ou de format. Sur Kathbath Noisy, un ensemble de fichiers compressés, tronqués ou bruités, Sarvam affirme que son taux d’erreur est inférieur de moitié à celui de Deepgram Nova-3 et de GPT-4o Transcribe, toujours selon ses propres mesures.

La détection de langue affiche, selon Sarvam, un taux d’erreur de 2,9 % sur les dix principales langues indiennes et de 5,22 % sur l’ensemble des 22 langues, sur des énoncés vérifiés d’IndicVoices. Là encore, les résultats sont vendor-reported et n’ont pas encore été reproduits publiquement.

Streaming rapide, diarisation et prix API

Le modèle est déjà accessible par API, avec un mode WebSocket pour le streaming. Sarvam annonce un time to first token inférieur à 150 ms, ce qui compte pour les usages interactifs. La transcription synchrone via REST est limitée à des clips de 30 secondes, tandis que les traitements batch montent jusqu’à 2 heures par fichier, avec diarisation optionnelle, c’est-à-dire séparation des locuteurs.

La tarification annoncée est de 30 roupies indiennes par heure pour la transcription en temps réel, le streaming et le batch, puis 45 roupies par heure avec diarisation. Les SDKs visent Python 3.9+ et Node.js 18+, avec des intégrations annoncées pour LiveKit Agents, Pipecat et Vercel AI SDK. Sarvam précise aussi que Saaras v3 reste le modèle par défaut pour l’instant, et que la documentation de self-hosting sur SageMaker couvre encore la version précédente.

Une place à part sur un marché dominé par l’anglais

Sarvam compare Saaras V4 à Deepgram Nova-3, ElevenLabs Scribe v2 et OpenAI GPT-4o Transcribe. Sur le papier, le modèle se distingue par le nombre de langues indiennes couvertes, par le nombre de sorties natives, et par son orientation très marquée vers les usages multilingues du sous-continent. Les concurrents gardent toutefois des atouts différents, notamment sur l’ampleur linguistique globale ou la maturité d’intégration cloud.

Le pari de Sarvam est assez lisible : proposer un moteur vocal unique pour les marchés où l’anglais ne suffit pas. Dans ce contexte, le vrai sujet n’est pas seulement la précision brute, mais la capacité à préserver noms propres, accents, scripts et formats sans bricolage en aval. C’est souvent là que les démos brillantes se froissent, très vite.

Points clés

  • Saaras V4 couvre 22 langues indiennes et l’anglais.
  • Sarvam annonce un accès API immédiat, sans weights publics.
  • Le mode streaming affiche moins de 150 ms de TTFT.
  • Le pricing commence à 30 roupies indiennes par heure.
  • Le modèle ajoute le keyterm prompting jusqu’à 50 termes.
  • Sarvam dit rester en v3 pour le self-hosting SageMaker.

En chiffres

  • 22 langues — langues indiennes officielles couvertes par Saaras V4, selon Sarvam.
  • 3 milliards de paramètres — taille de Sarvam-3B, le décodeur utilisé par le modèle.
  • 150 ms — temps de première réponse annoncé en streaming WebSocket.
  • 30 roupies indiennes/heure — tarif API annoncé pour transcription en temps réel, streaming et batch.
  • 2,9 % — taux d’erreur de détection de langue revendiqué sur les dix principales langues indiennes.

À lire