Ricerca
Best-of-$N$ Guidance per l’allineamento dei modelli di diffusione in fase di inferenza
I modelli di diffusione ottengono ottimi risultati nella generazione di contenuti, ma spesso faticano ad allineare i campioni generati alle preferenze umane misurate da un modello di ricompensa. Un al

- arXiv
- 2610.05108
- Pubblicato
- 2026-10-04
- Autori
- Richard Lee Kim, Yeongmin Kim, Gyuwon Sim, Taekyu Kim, Minsang Park, Il-chul Moon
Abstract degli autori
I modelli di diffusione ottengono ottimi risultati nella generazione di contenuti, ma spesso faticano ad allineare i campioni generati alle preferenze umane misurate da un modello di ricompensa. Un algoritmo semplice ma efficace per l’allineamento in fase di inferenza è il campionamento Best-of-$N$ (BoN): estrae $N$ campioni indipendenti e identicamente distribuiti da un modello di diffusione preaddestrato e restituisce il singolo campione con la ricompensa più alta. Nonostante i risultati empirici, BoN sfrutta solo in misura limitata le informazioni sulla ricompensa: le usa soltanto nella selezione finale, senza influenzare la traiettoria della diffusione inversa durante il campionamento. Di conseguenza, il campionamento BoN non migliora l’allineamento medio dei campioni generati ed è adatto soprattutto ai contesti in cui serve un solo risultato. Proponiamo Best-of-$N$ Guidance (BoNG), un nuovo metodo che integra il principio del campionamento BoN direttamente nel processo di diffusione inversa. BoNG esegue una selezione BoN durante la generazione tra le particelle sottoposte a rimozione del rumore e modifica il processo di diffusione inversa per orientare la popolazione di particelle verso regioni con ricompense più alte. In particolare, introducendo un’interazione di guida asimmetrica tra le particelle sottoposte a rimozione del rumore, BoNG usa la particella BoN corrente come segnale di guida per le altre particelle. Questa interazione tra particelle orienta il campionamento verso regioni con ricompense più alte, consentendo a BoNG di migliorare non solo il miglior campione finale rispetto al campionamento Vanilla BoN, ma anche la qualità media dei campioni generati. Su 36 confronti empirici, BoNG ottiene il risultato migliore in 29 casi, classificandosi al primo posto nell’80,56% dei confronti con SMC e con il campionamento Vanilla BoN. BoNG consente inoltre di produrre più risultati, raggiungendo un punteggio ImageReward pari a 1,3$\times$ quello del più recente metodo di guida basato sui campioni, con un’accelerazione di 1,6$\times$. Il codice è disponibile all’indirizzo https://github.com/aailab-kaist/BoNG.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv