The Pulse
Voice of Reason di Kyutai ottiene il 70,6% su GSM8K
GLM-4-Voice of Reason di Kyutai è un modello da parlato a parlato che ragiona prima di parlare e ottiene un punteggio di 0,706 in una valutazione GSM8K su 1.310 quesiti, condotta sul canale testuale.

AI.info Team ·
GLM-4-Voice of Reason di Kyutai è un modello da parlato a parlato addestrato per ragionare prima di parlare. La scheda del modello riporta un punteggio di 0,706, pari al 70,6%, in una valutazione GSM8K su 1.310 quesiti, condotta sul canale testuale e con gpt-4o-2024-11-20 come valutatore.
Il modello si basa su GLM-4-Voice-9B ed è addestrato con reinforcement learning, usando come valutatore un modello linguistico binario, su problemi matematici formulati a parole. La scheda del modello di Kyutai specifica che non è prevista una fase di fine-tuning supervisionato per il comportamento di ragionamento: il modello apprende tale comportamento dal segnale di ricompensa.
Il ragionamento fa parte della risposta parlata
GLM-4-Voice of Reason accetta input vocali e produce una risposta parlata. Il suo ragionamento non viene collocato in un canale nascosto separato. Il modello affronta invece il problema passo dopo passo nella risposta che pronuncia.
L’esempio riportato nella scheda del modello istruisce il sistema a rispondere in modo intercalato, con 13 token testuali seguiti da 26 token audio. Nel flusso di lavoro mostrato, l’output generato contiene sia token testuali sia token vocali. Il testo può essere decodificato come risposta completa, mentre i token vocali rappresentano i codici audio che saranno convertiti in una forma d’onda.
Questa architettura mantiene il ragionamento e la risposta all’interno dello stesso processo di generazione vocale. La scheda descrive il sistema come un modello da parlato a parlato, anziché come una normale pipeline vocale che prima trascrive il parlato, invia il testo a un modello linguistico separato e poi ne sintetizza il risultato.
Un risultato su benchmark legato a una configurazione specifica
Il punteggio di 0,706 su GSM8K riportato è accompagnato da diverse precisazioni. Riguarda 1.310 quesiti del test, utilizza il canale testuale e si basa su gpt-4o-2024-11-20 come valutatore. Il dato descrive quindi uno specifico protocollo di valutazione, non una misura generale delle capacità matematiche in qualsiasi contesto vocale.
La scheda del modello inquadra il compito come la risoluzione di problemi matematici formulati a parole. Poiché il valutatore fornisce una valutazione binaria basata su un modello linguistico, il risultato riflette sia la risposta generata dal modello sia la procedura utilizzata per classificarla. La scheda non presenta il punteggio come il risultato di un verificatore simbolico.
Per l’esecuzione in locale servono i componenti di GLM-4-Voice
La versione rilasciata da Kyutai è pensata per essere eseguita in locale. La scheda del modello specifica che il front end audio è ereditato da GLM-4-Voice e non è incluso nel repository. Per ottenere il tokenizer vocale, gli utenti devono clonare il repository di GLM-4-Voice e poi utilizzare i token vocali generati dal modello con il decoder di GLM-4-Voice per produrre una forma d’onda.
L’esempio pubblicato utilizza Transformers, PyTorch, Torchaudio, Accelerate, Tiktoken e SoundFile. Accetta file audio leggibili da Torchaudio, compresi quelli con qualsiasi frequenza di campionamento supportata dalla libreria audio. L’esempio carica il checkpoint in bfloat16 e lo esegue su un dispositivo CUDA.
Kyutai afferma che lo script riportato è stato eseguito su una singola GPU H100 con Transformers 4.47.1 e PyTorch 2.8.0. La scheda del modello avverte inoltre che la versione di PyTorch appropriata dipende dal driver CUDA del sistema, poiché le versioni più recenti dei pacchetti possono richiedere una versione di CUDA più recente di quelle disponibili in alcuni cluster.
Un checkpoint aperto per la ricerca sul ragionamento parlato
GLM-4-Voice of Reason mette a disposizione dei ricercatori un checkpoint accessibile liberamente per studiare il ragionamento durante la generazione audio. Il progetto punta a un unico modello nativo per il parlato, in grado di elaborare una domanda audio, generare passaggi intermedi di ragionamento e fornire la risposta a voce.
Il rilascio è quindi utile sia come modello sia come esperimento locale riproducibile. Il risultato sul benchmark è del 70,6% nella configurazione GSM8K specificata, mentre il codice allegato mostra come estrarre i token vocali, decodificare la risposta testuale e passare i codici audio a un decoder. La scheda del modello non avanza affermazioni più ampie sulle prestazioni oltre questa valutazione.