Vai al contenuto
AI.info

The Pulse

Apple illustra DACA-GRPO per i modelli linguistici a diffusione

La pagina di ricerca di Apple del settembre 2026 descrive DACA-GRPO, un metodo di apprendimento per rinforzo per i modelli linguistici a diffusione.

Apple illustra DACA-GRPO per i modelli linguistici a diffusione

AI.info Team ·

Apple punta su due punti deboli nell’addestramento dei modelli a diffusione

I ricercatori di Apple hanno proposto un metodo di apprendimento per rinforzo pensato per migliorare il modo in cui i modelli linguistici a diffusione apprendono dai premi. La tecnica, chiamata Denoising-Aware Credit Assignment for GRPO, o DACA-GRPO, si concentra sulla sequenza di decisioni intermedie di denoising che trasformano gradualmente i token corrotti in una risposta completa.

Il lavoro affronta due problemi individuati dagli autori. I metodi di apprendimento per rinforzo esistenti per i modelli linguistici a diffusione considerano ogni passaggio di denoising ugualmente importante, anche se alcuni passaggi hanno un effetto maggiore sul risultato finale. Inoltre, si basano su stime di verosimiglianza a campo medio che, secondo i ricercatori, sono sistematicamente distorte e presentano un’elevata varianza.

Apple ha pubblicato la ricerca nel settembre 2026. Il paper è stato scritto da Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang e Irina Belousova. La pagina di ricerca di Apple identifica il lavoro come un paper sui metodi e gli algoritmi che tratta l’elaborazione del parlato e del linguaggio naturale.

DACA-GRPO assegna il merito all’interno della traiettoria di denoising

DACA-GRPO aggiunge due meccanismi agli addestratori in stile GRPO. Il primo, chiamato Denoising Progress Scores, ricava pesi di importanza per ciascun token dalle previsioni intermedie. Secondo i ricercatori, questi punteggi non richiedono passaggi in avanti aggiuntivi e consentono all’addestratore di stimare quali token e fasi di denoising abbiano contribuito maggiormente al risultato finale.

Il secondo meccanismo, Stratified Masking Likelihood, suddivide le posizioni dei token in gruppi, o strati. Ogni token viene quindi valutato disponendo come contesto della maggior parte della sequenza. Il sistema è concepito per ridurre la distorsione introdotta quando i calcoli della verosimiglianza approssimano l’intera sequenza usando una stima a campo medio.

Questa combinazione modifica il segnale di addestramento senza richiedere una nuova architettura del modello. Apple descrive DACA-GRPO come un miglioramento leggero applicabile a qualsiasi addestratore in stile GRPO: la proposta interviene quindi sul post-addestramento, anziché sostituire il preaddestramento dei modelli linguistici a diffusione.

Risultati su ragionamento, codice e output strutturato

I ricercatori applicano DACA-GRPO a tre metodi di base GRPO e valutano i sistemi risultanti su sette benchmark. I test riguardano il ragionamento matematico, la generazione di codice, il rispetto dei vincoli e la generazione vincolata.

Apple riporta incrementi massimi di 5,6 punti percentuali nei compiti di ragionamento matematico e di 7,4 punti in quelli di generazione di codice. Il miglioramento maggiore si registra nel rispetto dei vincoli, dove l’incremento riportato raggiunge i 36,3 punti. Il metodo migliora anche il rispetto degli schemi JSON fino a 5,9 punti.

Le cifre indicano miglioramenti nell’intera suite di benchmark, non un unico punteggio complessivo. La sintesi di Apple non specifica una dimensione del modello o una configurazione di addestramento come responsabile di tutti gli incrementi massimi; i risultati principali vanno quindi interpretati come i migliori miglioramenti osservati tra gli esperimenti riportati.

Perché i passaggi intermedi contano nei modelli linguistici a diffusione

I modelli linguistici autoregressivi producono testo un token alla volta, offrendo a molti metodi convenzionali di apprendimento per rinforzo una sequenza di decisioni relativamente diretta da ottimizzare. I modelli linguistici a diffusione seguono un percorso diverso: partono da una rappresentazione fortemente corrotta o mascherata e affinano ripetutamente molte posizioni lungo una traiettoria di denoising.

Un premio finale, come un punteggio assegnato a una soluzione corretta o a un codice valido, non rivela automaticamente quali decisioni intermedie l’abbiano prodotto. Trattare tutte le fasi allo stesso modo può quindi trasmettere lo stesso segnale di apprendimento sia ai passaggi che hanno dato forma alla risposta, sia a quelli che si sono limitati a rifinire una sequenza già coerente.

DACA-GRPO cerca di rendere esplicita questa distinzione. I suoi punteggi di progresso stimano l’importanza dei token durante il perfezionamento, mentre i calcoli stratificati della verosimiglianza mirano a fornire all’ottimizzatore della policy una visione meno distorta delle probabilità del modello. L’approccio mantiene la struttura relativa ai gruppi di GRPO, aggiungendo informazioni su quando e dove ha preso forma l’output.

Una direzione di ricerca per i modelli linguistici non autoregressivi

I modelli linguistici a diffusione hanno suscitato interesse perché possono modificare più posizioni di una sequenza, invece di attenersi a un percorso di generazione rigorosamente da sinistra a destra.

DACA-GRPO affronta un problema più circoscritto: come applicare l’apprendimento per rinforzo dopo aver addestrato un modello linguistico a diffusione. I risultati riportati suggeriscono che la traiettoria di denoising contiene informazioni utili per l’addestramento che le implementazioni standard di GRPO non utilizzano. Il paper non dimostra che il metodo migliorerà ogni architettura o compito basato sulla diffusione, ma offre un modo per testare l’assegnazione del merito consapevole della traiettoria senza ricostruire da zero l’addestratore.

La descrizione tecnica principale è disponibile su Apple Machine Learning Research, mentre il paper completo è disponibile tramite arXiv.

Fonte

Esplora

Altri articoli