The Pulse
Un paper di Apple usa probe sugli stati nascosti per guidare i modelli di flusso
Un paper pubblicato il 16 settembre da ricercatori di Apple introduce la guida tramite probe, che utilizza una piccola rete addestrata sugli stati nascosti di un modello di flusso. I test riportano miglioramenti nella generazione di testo e

AI.info Team ·
La guida tramite probe ha aumentato di 16,8 punti il punteggio BoolQ di un modello di flusso da 1,7 miliardi di parametri, secondo un paper presentato il 16 settembre. Il metodo, introdotto dagli autori in un paper pubblicato sul sito di ricerca sul machine learning di Apple, utilizza una piccola rete addestrata sugli stati interni congelati di un modello più grande per orientare la generazione di testo. Gli autori riportano anche un miglioramento di 1,4 punti sul benchmark più impegnativo SIQA. I risultati sono valutazioni di ricerca, non l’annuncio di un nuovo prodotto Apple.
Un aumento di 16,8 punti su BoolQ
I ricercatori hanno testato la guida tramite probe su un modello linguistico a diffusione continua, un tipo di modello che genera testo perfezionando iterativamente una rappresentazione rumorosa, invece di produrre un token alla volta. Su BoolQ, il punteggio del modello è salito da 42,0 senza guida a 58,8 con la guida, nell’impostazione più efficace tra le due testate nel paper. Su SIQA, il punteggio è aumentato da 38,4 a 39,8. Il paper valuta anche ARC-E, OpenBookQA, PIQA e RACE, riportando miglioramenti o risultati alla pari nell’intera serie di test a scelta multipla.
Per interpretare questi numeri, il confronto è tra versioni guidate e non guidate della stessa configurazione di modello: non si afferma che il sistema superi nel complesso i modelli linguistici più avanzati. Nella tabella del paper, il punteggio medio del modello guidato raggiunge 44,5, al di sotto del 47,1 riportato per Duo, un modello a diffusione discreta incluso come termine di confronto. Gli autori affermano che, nella maggior parte delle categorie, la guida porta il modello continuo vicino alla parità con gli approcci discreti.
Un probe riutilizza stati già calcolati dal modello
La guida tramite probe funziona addestrando un percettrone multistrato leggero, o MLP, sugli stati nascosti di un modello congelato. Il probe agisce come una versione più debole del modello principale; in fase di inferenza, la differenza tra il suo output e quello del modello principale fornisce una direzione per modificare la generazione. Poiché il modello principale ha già calcolato quegli stati nascosti, il passaggio di guida aggiunge una valutazione dell’MLP, anziché un secondo passaggio completo attraverso un modello separato.
Il paper stima che i probe richiedano circa il 2% del calcolo del modello e afferma che, in fase di inferenza, si usano da 1,4 a 2,0 volte meno operazioni in virgola mobile rispetto all’autoguida, che esegue un modello più debole insieme a quello principale. Gli autori stimano che l’addestramento dei probe aggiunga circa l’1% al calcolo necessario per l’addestramento. Queste cifre descrivono l’approccio e i confronti testati nel paper; non dimostrano risparmi di tempo o di costi per ogni modello o implementazione.
I miglioramenti nella generazione dipendono dalla valutazione
Il team ha testato anche la generazione di testo non condizionata con due famiglie di modelli: ELF, che genera in uno spazio latente appreso, e FLM, che opera su rappresentazioni dei token. Sul modello ELF più grande, gli autori riportano che la guida tramite probe ha ridotto la perplessità generativa da 38 a 23, con un livello di entropia pari a 5,40. In questa valutazione, una perplessità più bassa indica una qualità del testo misurata più alta, mentre l’entropia è un indicatore della diversità. Secondo il paper, nei test il modello guidato ha migliorato il compromesso tra qualità e diversità.
Il risultato deriva da esperimenti su OpenWebText, per i quali i ricercatori hanno generato 1.000 campioni da valutare. Va interpretato come un risultato di benchmark, non come prova che gli output guidati siano sempre migliori per qualsiasi attività di scrittura. I test del paper si concentrano su famiglie di modelli e metodi di valutazione selezionati, non sull’uso nel mondo reale da parte delle persone.
Gli autori individuano limiti nei modelli linguistici
Il lavoro esamina anche perché l’autoguida — una tecnica già esistente che orienta la generazione usando un modello più debole — possa non funzionare nelle attività linguistiche. In esperimenti con modelli addestrati da zero, gli autori hanno scoperto che la guida dipendeva dall’uso di un checkpoint debole, appartenente a una fase a bassa entropia e precedente al brusco aumento dell’entropia del modello durante l’addestramento. Nei test, i checkpoint successivi non fornivano un segnale utile.
I ricercatori avvertono che i modelli linguistici a diffusione continua sono ancora inferiori ai modelli linguistici autoregressivi standard e affermano che le ragioni per cui la guida funziona non sono del tutto chiare. Il loro paper su arXiv presenta la guida tramite probe come un modo per studiare e migliorare questi modelli, lasciando aperta la questione se i miglioramenti misurati si estenderanno a benchmark più ampi e a sistemi pratici.