Vai al contenuto
AI.info

Ricerca

Un paradigma di ordine zero per l’allineamento degli LLM alle preferenze

I metodi di allineamento diretto alle preferenze sono ampiamente usati per allineare i grandi modelli linguistici (LLM) alle preferenze umane, grazie alla loro efficienza computazionale e nell’uso del

Un paradigma di ordine zero per l’allineamento degli LLM alle preferenze
arXiv
2609.19144
Pubblicato
2026-09-16
Autori
Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

Abstract degli autori

I metodi di allineamento diretto alle preferenze sono ampiamente usati per allineare i grandi modelli linguistici (LLM) alle preferenze umane, grazie alla loro efficienza computazionale e nell’uso della memoria. Tuttavia, lo spostamento della verosimiglianza spinge a cercare modi alternativi per estrarre informazioni dalle coppie di preferenze con margini di verosimiglianza ridotti. In questo articolo proponiamo e analizziamo Comparison-based Preference Optimization (ComPO), un metodo di allineamento di ordine zero basato su oracoli di confronto. ComPO estrae informazioni direzionali da queste coppie senza ottimizzare direttamente su di esse una funzione di perdita differenziabile relativa alle preferenze. Stabiliamo una garanzia di convergenza per il suo schema offline di base sotto ipotesi di regolarità, sparsità del gradiente e compatibilità tra l’oracolo e un obiettivo latente. Introduciamo inoltre ComPO online, che conserva il meccanismo di confronto offline e usa generazioni non etichettate della policy per controllare la divergenza KL inversa rispetto a una policy di riferimento. Adottando la prospettiva della copertura nel fine-tuning basato sulle preferenze, stabiliamo una garanzia di prestazione per uno schema vincolato di base, sotto ipotesi di copertura locale e accuratezza della ricompensa a coppie sulla distribuzione. Esperimenti sui modelli Mistral, Llama, Gemma-2, Qwen3 e Gemma-3 mostrano miglioramenti rispetto ai metodi esistenti di allineamento diretto, anche nei tassi di vittoria controllati per la lunghezza. Le analisi diagnostiche a livello di coppia forniscono evidenze compatibili con un’attenuazione dello spostamento della verosimiglianza.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv