Le traitement de la parole et la transcription audio connaissent une révolution continue, notamment grâce aux avancées des grands modèles de langage et des architectures audio neuronales. Nvidia franchit une nouvelle étape majeure avec la sortie de Nemotron 3 Diarization, un modèle open-poids (open-weight) de pointe spécialisé dans la diarisation des locuteurs. Conçu pour identifier avec précision « qui a parlé et quand » dans des environnements audio réels, ce modèle supporte jusqu'à huit locuteurs simultanés et fonctionne aussi bien en mode streaming qu'en mode hors ligne (offline).
Comprendre la diarisation des locuteurs et le défi du streaming
La diarisation des locuteurs consiste à segmenter un flux audio en fonction de l'identité des personnes qui prennent la parole. C'est une brique fondamentale pour les assistants vocaux, l'analyse de réunions d'entreprise, les podcasts et les centres d'appels. Toutefois, réaliser cette tâche en temps réel (streaming) tout en maintenant une faible latence représente un défi technique considérable : il faut résoudre le problème de la permutation des locuteurs et préserver leur identité au fil du temps sans tout recalculer à chaque bloc audio.
Pour relever ce défi, Nemotron 3 Diarization s'appuie sur l'architecture Sortformer et intègre deux mécanismes clés pour le traitement en flux continu :
- L'Arrival-Order Speaker Cache (AOSC) : un cache qui conserve les informations des locuteurs identifiés dans les blocs précédents afin de préserver leur cohérence identitaire.
- Une file d'attente FIFO (First-In, First-Out) : qui fournit le contexte des trames récentes nécessaires à chaque étape de traitement.
Architecture technique et performances
Doté de 100 millions de paramètres, Nemotron 3 Diarization repose sur un encodeur Transformer à 31 couches combiné à des embeddings positionnels rotatifs (RoPE). L'entrée audio est constituée de caractéristiques Mel-spectrogrammes à 10 ms, sous-échantillonnées d'un facteur 8 pour produire un taux de trame de l'encodeur de 80 ms, avant d'être ré-échantillonnées à la résolution originale de 10 ms via une couche Conv1D.
Les configurations de latence sont ajustables selon les besoins applicatifs, allant du mode ultra-basse latence (0,32 seconde) au mode hors ligne haute précision (30,4 secondes).
Les évaluations comparatives menées sur des benchmarks exigeants tels que DIHARD III et CALLHOME-Part2 démontrent une réduction drastique du taux d'erreur de diarisation (DER) par rapport aux générations précédentes de modèles Nvidia, tout en offrant des performances de traitement en temps réel (RTFx) extrêmement élevées, particulièrement lorsqu'elles sont combinées à l'optimisation torch.compile() sur les GPU Nvidia Blackwell.
Intégration et écosystème logiciel
Nemotron 3 Diarization s'adresse directement aux ingénieurs et chercheurs en traitement de la parole cherchant à déployer des pipelines conversationnels robustes. Le modèle profite de l'écosystème matériel de pointe de Nvidia, prenant en charge un large éventail d'architectures de GPU (depuis les séries Ampere et Ada Lovelace jusqu'aux puces Blackwell et Hopper).
Que ce soit via l'environnement NeMo Framework v3.0, l'utilitaire natif C++ NeMo-Speech.cpp pour les environnements contraints, ou directement via Hugging Face Transformers, ce modèle représente une avancée majeure pour standardiser et industrialiser la compréhension audio multilocuteur dans les applications d'intelligence artificielle modernes.
