Vai al contenuto
AI.info

Ricerca

La catena linguistica nell’allineamento: ottimizzazione delle preferenze mediante ranking interlinguistico

L’allineamento dei modelli linguistici di grandi dimensioni si basa in larga misura su dati di alta qualità relativi alle preferenze, prevalentemente in inglese, e questo spesso porta a prestazioni no

La catena linguistica nell’allineamento: ottimizzazione delle preferenze mediante ranking interlinguistico
arXiv
2608.23149
Pubblicato
2026-08-24
Autori
Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

Abstract degli autori

L’allineamento dei modelli linguistici di grandi dimensioni si basa in larga misura su dati di alta qualità relativi alle preferenze, prevalentemente in inglese, e questo spesso porta a prestazioni non ottimali in altre lingue. In questo articolo proponiamo Cross-lingual Ranking Preference Optimization~(CRPO), un nuovo metodo che sfrutta le solide conoscenze sulle preferenze acquisite dall’inglese per favorire l’allineamento alle preferenze nella lingua di destinazione. Progettiamo una struttura gerarchica di coppie parallele di preferenze nella lingua di destinazione e in inglese per ottimizzare congiuntamente le preferenze intralinguistiche e interlinguistiche, migliorando così l’adattamento linguistico e la qualità delle risposte. Basato sul metodo LambdaLoss, CRPO va oltre l’ottimizzazione fondata su confronti binari, fornendo un segnale di ranking relativo tra più risposte candidate. I nostri esperimenti su cinque lingue con diverse disponibilità di risorse mostrano che CRPO supera costantemente gli approcci standard sia nella capacità di seguire le istruzioni sia nell’utilizzo delle conoscenze. In particolare, i solidi miglioramenti delle prestazioni osservati con diversi schemi di ponderazione confermano ulteriormente l’efficacia empirica della nostra struttura gerarchica in un contesto multilingue. I nostri risultati mostrano inoltre che CRPO migliora significativamente sia i margini di ricompensa sia la log-probabilità delle risposte desiderabili, contribuendo a rendere più stabile la varietà delle preferenze per l’allineamento interlinguistico. Il nostro codice è disponibile all’indirizzo https://github.com/dltmddbs100/CRPO.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv