NVIDIA muscle la diarisation vocale en temps réel jusqu’à huit voix
NVIDIA publie Nemotron 3 Diarization, un modèle open-weight de 100 millions de paramètres capable de suivre jusqu’à huit locuteurs, y compris en chevauchement. L’outil vise les usages de transcription, d’analyse d’appels et de réunions en direct.
NVIDIA a publié Nemotron 3 Diarization, un modèle de diarisation vocale open-weight de 100 millions de paramètres capable d’identifier qui parle quand, jusqu’à huit voix, y compris en cas de chevauchement. L’enjeu est concret : sans attribution des locuteurs, une transcription reste lisible mais perd une partie de son sens pour les réunions, les centres d’appels ou les outils de synthèse automatique. Le modèle est annoncé sur Hugging Face et pensé pour fonctionner en mode offline comme en streaming.
Ce que change la diarisation, au-delà du simple texte
La reconnaissance automatique de la parole transcrit les mots, mais ne dit pas qui les a prononcés. La diarisation ajoute cette couche d’attribution en repérant les intervalles où chaque voix est active, ce qui permet ensuite de combiner timestamps et ASR pour produire une transcription sourcée par locuteur. Dans une réunion, la différence est nette : savoir qu’une promesse vient du bon intervenant évite les contresens, et les résumés gagnent en fiabilité. La blague, ici, c’est que le vrai progrès consiste surtout à remettre de l’ordre dans une conversation déjà partie un peu dans tous les sens.
Selon NVIDIA, Nemotron 3 Diarization remplace la limite à quatre voix de son précédent Streaming Sortformer par un support allant jusqu’à huit speakers. Le modèle suit l’approche Sortformer, qui classe les locuteurs selon leur ordre d’apparition, afin de stabiliser les étiquettes entre les chunks audio en streaming. Cette logique évite de réassigner les voix à chaque fragment, un point clé dès qu’il faut traiter des appels longs ou des réunions hachées par les interruptions.
Un modèle unique pour l’offline et le temps réel
L’architecture repose sur de l’audio mono 16 kHz, converti en Mel-spectrogrammes, puis traité par un Transformer à 31 couches avec positionnement rotatif. Une couche Conv1D remet ensuite les prédictions à la résolution initiale, avec un tenseur de sortie de type [T, 8] indiquant la probabilité d’activité de chaque voix à chaque instant. Deux mécanismes de mémoire servent au streaming : un Arrival-Order Speaker Cache, qui conserve le contexte des locuteurs déjà vus, et une file FIFO qui garde l’historique récent. Le modèle peut donc couvrir plusieurs points de latence avec une seule base technique.
La version présentée prend en charge des configurations allant de 30,4 secondes de latence d’entrée à 0,32 seconde en mode ultra-faible latence. NVIDIA précise toutefois que cette latence n’inclut ni le calcul, ni le réseau, ni la couche ASR, ni le traitement applicatif. Autrement dit, le chiffre est utile, mais il ne raconte pas toute l’histoire du produit final.
Des résultats solides, avec une nuance à garder en tête
Sur Voice Arena, Nemotron 3 Diarization se classe premier dans les premiers résultats de Diarization-Bench, avec un taux d’erreur de diarisation de 14,72 % sur 139 conversations anglaises, soit environ 22 heures d’audio, devant 19,3 % pour le système arrivé derrière. Le gain relatif est d’environ 24 %. NVIDIA précise que ces résultats initiaux peuvent encore évoluer à mesure que l’évaluation Version 1 se termine [à vérifier].
Sur les benchmarks internes décrits dans la note technique, le modèle améliore aussi ses résultats face au précédent baseline Streaming Sortformer sur les huit jeux de test évalués à 1,04 seconde de latence. Le gain moyen relatif atteint 41,0 %, avec des écarts allant de 9,0 % sur CALLHOME-Part2 à 65,2 % sur NOTSOFAR1 MHM. Une nuance demeure : sur le sous-ensemble deux locuteurs de CALLHOME, le score se dégrade légèrement, de 5,68 % à 5,98 %, même si l’ensemble CALLHOME-Part2 progresse de 10,32 % à 9,10 %.
Pour qui cela compte vraiment
Le modèle vise des usages très concrets : transcription de réunions, analyse d’appels clients, outils de podcast, ou encore agents vocaux qui doivent se souvenir de qui a dit quoi. NVIDIA indique aussi qu’Argmax a déjà intégré Nemotron 3 Diarization dans Argmax Pro SDK 3 pour de l’attribution en temps réel sur appareil, ce qui montre l’intérêt de ce type de brique pour l’embarqué. Côté licences, le modèle est annoncé sous OpenMDW License 1.1, avec un usage commercial autorisé.
Reste une limite structurelle : au-delà de huit locuteurs, ou dans des environnements très bruités, réverbérants ou captés à distance, la qualité peut baisser. Le modèle sait donc faire beaucoup, mais pas transformer un open space en studio. Pour les équipes produit, le vrai sujet devient alors le calibrage entre précision, latence et coût d’infrastructure, plutôt que le simple score de benchmark.
Points clés
- Nemotron 3 Diarization suit jusqu’à huit locuteurs.
- Voice Arena le classe premier avec 14,72 % DER.
- Le gain moyen relatif atteint 41,0 % à 1,04 seconde.
- Le support dépasse le précédent Sortformer à quatre voix.
- Les résultats initiaux couvrent 139 conversations anglaises.
- NVIDIA publie le modèle le 23 septembre 2026.
En chiffres
- 100 millions — paramètres du modèle, selon NVIDIA.
- 8 voix — nombre maximal de locuteurs pris en charge.
- 14,72 % — DER sur Voice Arena, premiers résultats de Diarization-Bench.
- 41,0 % — réduction relative moyenne du DER à 1,04 seconde.
- 21 langues — langues couvertes par les mixtures simulées d’entraînement.