Vai al contenuto
AI.info

The Pulse

NVIDIA rilascia il modello Nemotron 3 per la diarizzazione, con 100 milioni di parametri

NVIDIA ha rilasciato Nemotron 3 Diarization, un modello a pesi aperti che identifica quando parlano fino a otto interlocutori, anche in presenza di parlato sovrapposto. Il modello è al primo posto nella prima edizione del Diarization-Bench

NVIDIA rilascia il modello Nemotron 3 per la diarizzazione, con 100 milioni di parametri

AI.info Team ·

Un modello di NVIDIA con 100 milioni di parametri registra un tasso di errore di diarizzazione del 14,72% nel benchmark iniziale di VoiceArena, classificandosi al primo posto tra 12 sistemi e 17 configurazioni testati su circa 22 ore di conversazioni in inglese.

NVIDIA ha rilasciato Nemotron 3 Diarization il 23 settembre 2026, presentandolo come un sistema a pesi aperti per conversazioni in tempo reale e registrate. Il modello identifica quando gli interlocutori parlano, mantiene i canali degli interlocutori nell’audio in streaming e segnala il parlato sovrapposto, invece di ricondurre le voci simultanee a un’unica etichetta.

La diarizzazione è distinta dal riconoscimento vocale: il modello produce l’attività degli interlocutori e i timestamp, non una trascrizione. Gli sviluppatori possono combinare il suo output con un sistema di riconoscimento vocale automatico per creare trascrizioni che collegano le parole a etichette anonime come speaker_0 e speaker_1.

Nemotron 3 supera il modello di riferimento di NVIDIA per quattro interlocutori

Nella prima edizione del Diarization-Bench, VoiceArena colloca Nemotron 3 Diarization davanti al sistema successivo in classifica, che ha registrato un tasso di errore del 19,3% con l’impostazione collar di zero secondi del benchmark. NVIDIA descrive il risultato come una riduzione relativa di circa il 24%, precisando però che la valutazione della versione 1 di VoiceArena e l’analisi statistica non sono ancora complete.

Il benchmark comprende 139 conversazioni in inglese e include nel punteggio il parlato sovrapposto. NVIDIA afferma che Nemotron 3 si è classificato al primo posto anche con le impostazioni collar di 100 e 250 millisecondi, nonché nelle registrazioni dal vivo e online.

Il modello estende da quattro a otto il numero di interlocutori supportati dall’approccio Streaming Sortformer sviluppato in precedenza dall’azienda. Ordina i canali di output in base al momento in cui gli interlocutori intervengono: la prima voce rilevata per la prima volta diventa il primo canale, la successiva il secondo e così via. Questo sistema aiuta a mantenere stabili le etichette anonime degli interlocutori man mano che arrivano nuovi segmenti audio.

Otto canali, quattro impostazioni di latenza

Nemotron 3 Diarization accetta audio a 16 kHz su un singolo canale e lo converte in caratteristiche di spettrogramma Mel prima di elaborarlo con un encoder Transformer a 31 strati. L’output predefinito è un tensore tempo-per-otto di probabilità di attività degli interlocutori, che consente a due o più canali di restare attivi nello stesso frame quando le persone parlano contemporaneamente.

NVIDIA consiglia quattro modalità operative: 30,4 secondi per l’elaborazione in stile offline, 1,04 secondi per una bassa latenza, 0,64 secondi per una latenza molto bassa e 0,32 secondi per una latenza ultra bassa. Questi valori indicano soltanto la durata del buffer di input ed escludono il calcolo del modello, il trasferimento in rete, il riconoscimento vocale e l’elaborazione dell’applicazione.

L’azienda afferma che il modello può tecnicamente funzionare con un buffer di input di 80 millisecondi, ma indica 0,32 secondi come configurazione minima consigliata. Buffer più brevi riducono l’attesa, ma in genere abbassano l’accuratezza e la velocità di elaborazione; spetta quindi agli sviluppatori scegliere un’impostazione in base all’intera pipeline dell’applicazione.

Le prestazioni migliorano soprattutto con gruppi più numerosi

Su otto condizioni di valutazione con una latenza del buffer di input di 1,04 secondi, NVIDIA riporta un errore di diarizzazione inferiore per Nemotron 3 rispetto al suo precedente modello di streaming per quattro interlocutori. Le riduzioni relative vanno dal 9,0% su CALLHOME-Part2 al 65,2% sulla condizione NOTSOFAR1 MHM, con una riduzione media non ponderata del 41,0% nei dataset.

I risultati non sono uniformi in tutti i sottoinsiemi. Nel sottoinsieme CALLHOME con due interlocutori, Nemotron 3 registra un tasso di errore del 5,98%, contro il 5,68% del modello precedente. Nell’intera valutazione CALLHOME-Part2, tuttavia, il nuovo modello migliora il risultato dal 10,32% al 9,10%, con progressi maggiori nelle registrazioni con più interlocutori.

Su una NVIDIA RTX PRO 5000, usando BF16, una dimensione del batch di 32 e torch.compile(), il modello raggiunge un fattore di tempo reale di 15.113 nella configurazione da 30,4 secondi, contro 2.619 per il modello precedente. A 1,04 secondi, NVIDIA riporta un fattore di tempo reale di 865, contro 136 per il modello precedente. Si tratta di misurazioni della velocità di elaborazione in batch, non della latenza end-to-end su un singolo flusso.

Le etichette degli interlocutori non ne rivelano l’identità

Nemotron 3 Diarization produce canali anonimi e non determina che speaker_2 corrisponda a una persona specifica. Le applicazioni possono associare questi canali ai metadati di una riunione, ai profili utente o a sistemi separati di verifica dell’identità del parlante, ma questo livello di identificazione è esterno al modello.

NVIDIA ha addestrato il modello con dati vocali pubblici e concessi in licenza, comprese registrazioni con più interlocutori concesse in licenza da David AI. L’azienda afferma che altro audio di David AI ha fornito mix simulati in inglese e in più lingue, per un totale di 21 lingue, riducendo l’errore composto di diarizzazione di 0,77 punti percentuali nel confronto interno, dall’11,19% al 10,42%.

Il rilascio include esempi per NVIDIA NeMo Speech e supporta input WAV, FLAC, Opus e MP3 su sistemi Linux con GPU NVIDIA Ampere, Hopper o Blackwell supportate. NVIDIA segnala inoltre integrazioni con Argmax Pro SDK 3, Baseten e DigitalOcean. Il modello è regolato dal contratto di licenza OpenMDW, versione 1.1 e l’annuncio avverte che rumore, riverbero, microfoni a distanza, conversazioni lunghe e registrazioni con più di otto interlocutori possono aumentare gli errori.

Fonte

Esplora

Altri articoli