The Pulse
Uno studio legato ad Apple riduce a otto passaggi la generazione discreta di testo
Uno studio di ricerca legato ad Apple riferisce che un modello di flow matching discreto ha generato testo in otto passaggi, a una velocità 128 volte superiore rispetto a un modello insegnante che ne richiedeva 1.024. Negli esperimenti con

AI.info Team ·
128×. È il vantaggio in termini di velocità di inferenza dichiarato per un sistema discreto di generazione del testo legato ad Apple, che produce linguaggio in otto passaggi di campionamento anziché nei 1.024 usati dal suo modello insegnante. Nell’esperimento descritto nello studio con 170 milioni di parametri, lo studente a otto passaggi registra anche una perplexity inferiore del 32% rispetto al modello insegnante, secondo Apple Machine Learning Research.
Il risultato è tratto da «La traiettoria come insegnante: flow matching discreto in pochi passaggi tramite distillazione guidata dall’energia», uno studio di Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang e Irina Belousova. Lo studio indica affiliazioni alla Ohio State University e ad Apple e afferma che il lavoro è stato completato durante uno stage presso Apple.
Lo studio affronta un punto debole della generazione in pochi passaggi
I modelli di flow matching discreto generano testo trasformando ripetutamente una sequenza inizialmente priva di informazioni in linguaggio. La sequenza iniziale può contenere token casuali del vocabolario o token di mascheramento. A differenza di un modello autoregressivo, che emette i token uno alla volta, il sistema di flow matching aggiorna molte posizioni attraverso valutazioni ripetute del modello.
Questa struttura parallela può ridurre il carico sequenziale della generazione del testo, ma la qualità normalmente cala quando il numero di valutazioni passa da centinaia o migliaia a un budget di pochi passaggi. Secondo lo studio di Apple, il limite principale non è necessariamente la dimensione del modello studente. Lo studio sostiene invece che lo studente riceve una supervisione scadente, perché la sua traiettoria di addestramento contiene stati intermedi stocastici la cui qualità come sequenza non viene mai verificata.
Nella configurazione esaminata dagli autori, una procedura di Runge-Kutta del quarto ordine crea diversi stati intermedi. Ogni stato intermedio richiede scelte di token discreti. Una scelta debole nelle prime fasi della catena modifica l’input delle valutazioni successive, consentendo agli errori di accumularsi prima che lo studente apprenda dal risultato finale.
TS-DFM sostituisce i salti alla cieca con un controllo della qualità
Il metodo proposto, chiamato Trajectory-Shaped Discrete Flow Matching, o TS-DFM, aggiunge un piccolo modello energetico che lo studio definisce una «bussola energetica». Durante l’addestramento, il sistema genera diverse continuazioni candidate in un punto intermedio e assegna loro un punteggio, selezionando quella giudicata più coerente.
TS-DFM usa due fasi per effettuare la selezione. Una fase a livello di sequenza sceglie tra gli stati candidati, mentre una fase a livello di token perfeziona lo stato scelto usando le informazioni sulla confidenza già prodotte dal modello di velocità. Il metodo attiva la guida solo dopo una soglia temporale, perché gli autori hanno riscontrato che gli stati molto iniziali contengono troppo poca struttura linguistica significativa perché il punteggio di qualità possa essere utile.
La bussola energetica viene addestrata su stati del flusso parzialmente rivelati e su corruzioni legate alla generazione, anziché soltanto su testo pulito. Sui dati FineWeb-Edu tenuti da parte, lo studio riporta un’accuratezza dal 98,5% al 99,8% nel distinguere gli stati reali del flusso dalle corruzioni selezionate. Tutta questa guida viene applicata durante l’addestramento; secondo gli autori, non comporta costi aggiuntivi in fase di inferenza.
Otto passaggi superano il riferimento da 1.024 passaggi
L’esperimento principale con 170 milioni di parametri valuta la generazione incondizionata di sequenze da 1.024 token su WikiText-103. Gli autori confrontano distribuzioni iniziali uniformi di token casuali e di token di mascheramento, e valutano i risultati con i modelli di riferimento GPT-2 Large, LLaMA 2 7B e LLaMA 3 8B.
Con una sorgente uniforme e un’inizializzazione FS-DFM, il modello TS-DFM a otto passaggi raggiunge una perplexity di 56,1 secondo GPT-2. La baseline FS-DFM corrispondente ottiene 87,6, mentre il modello insegnante di flow matching discreto a 1.024 passaggi ottiene 82,8. Una perplexity più bassa indica che il valutatore assegna al testo generato una verosimiglianza maggiore.
Il miglioramento non si limita a un solo valutatore. Lo studio riporta risultati migliori con tutti e tre i modelli di riferimento e con budget di 16 e 32 passaggi. Con una sorgente mascherata, gli autori riportano un miglioramento di 5,6 volte rispetto alla baseline FS-DFM a otto passaggi, anche se i risultati con la sorgente mascherata dipendono da una diversa scelta di inizializzazione.
TS-DFM supera anche due sistemi di confronto presentati nello studio. A otto passaggi, registra una perplexity di 56,1 secondo GPT-2, contro 70,6 per Duo, che secondo lo studio è stato addestrato con un numero di token sei volte maggiore, e 105,8 per SDTT dopo sette cicli di distillazione, usando un modello cinque volte più grande.
Lo stesso andamento si osserva con 1,3 miliardi di parametri
Gli autori ripetono il test con sorgente uniforme usando uno studente da 1,3 miliardi di parametri, circa 7,6 volte più grande del modello principale. Usano la stessa bussola energetica da circa 90 milioni di parametri, invece di aumentarne le dimensioni insieme a quelle dello studente.
A otto passaggi, lo studente TS-DFM più grande raggiunge una perplexity di 48,0 secondo GPT-2 Large, inferiore al punteggio di 57,5 del suo modello insegnante a 1.024 passaggi. Lo studio indica per questo confronto lo stesso incremento di velocità di 128×. A parità di numero di passaggi, TS-DFM riduce la perplexity del 41% rispetto a FS-DFM, contro una riduzione del 36% nell’esperimento con 170 milioni di parametri.
La bussola più piccola diventa anche meno costosa rispetto allo studente all’aumentare delle dimensioni del modello. Lo studio stima un rapporto tra i parametri della bussola e quelli dello studente di circa uno a due con 170 milioni di parametri e di uno a quattordici con 1,3 miliardi di parametri. Anche un esperimento preliminare su GSM8K alla scala maggiore riporta risultati migliori rispetto a FS-DFM con budget di quattro e otto passaggi, ma gli autori lo presentano come uno studio aggiuntivo, non come il benchmark principale del lavoro.
Un’inferenza più veloce comporta un costo di addestramento
TS-DFM non rende gratuito l’addestramento. Con la soglia temporale predefinita, gli autori misurano su una singola GPU un sovraccarico in termini di tempo effettivo per passaggio pari a 2,2× rispetto a FS-DFM. Tra le soglie testate, il costo aggiuntivo va da 2,0× a 2,4×. Lo studio attribuisce questa spesa alla generazione di salti candidati, alla valutazione in batch dell’energia e al coordinamento del processo di selezione.
Questo compromesso è uno dei motivi per cui il risultato è rilevante soprattutto come metodo di addestramento, non come promessa relativa a un prodotto già pronto. L’incremento di velocità riportato riguarda lo studente a otto passaggi dello studio rispetto a un modello insegnante a 1.024 passaggi, nelle condizioni sperimentali indicate. Lo studio non descrive la distribuzione di un prodotto Apple, un modello linguistico in produzione o un servizio pubblico di generazione del testo che utilizzi TS-DFM.
Gli autori indicano anche due limiti. La bussola energetica viene addestrata una volta sola e poi congelata, quindi la sua utilità potrebbe diminuire man mano che cambia la distribuzione degli stati del flusso dello studente. La soglia di attivazione rimane fissa per tutto l’addestramento, lasciando a studi futuri la possibilità di esaminare programmi di soglie adattivi.
Per ora, il risultato più solido dello studio è specifico: uno studente distillato di flow matching discreto raggiunge una perplexity riportata inferiore a quella di un modello insegnante a 1.024 passaggi pur usandone otto, e lo stesso vantaggio in termini di qualità si osserva in un test con 1,3 miliardi di parametri. Resta da capire se il metodo manterrà questo vantaggio su attività più ampie e carichi di lavoro di produzione, al di là dei benchmark controllati dello studio.