Ricerca
Selezione dinamica di esempi importanti per il fine-tuning con rinforzo
Il fine-tuning con rinforzo (RFT) è sempre più usato per rafforzare le capacità di ragionamento dei modelli di grandi dimensioni, ma la sua efficacia dipende da come vengono selezionati e utilizzati i

- arXiv
- 2608.29252
- Pubblicato
- 2026-08-29
- Autori
- Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi
Abstract degli autori
Il fine-tuning con rinforzo (RFT) è sempre più usato per rafforzare le capacità di ragionamento dei modelli di grandi dimensioni, ma la sua efficacia dipende da come vengono selezionati e utilizzati i dati di addestramento. La maggior parte dei metodi RFT incentrati sui dati si basa su una selezione statica o euristica dei campioni, presupponendo implicitamente che il valore di un campione resti fisso durante l’addestramento. Questo trascura le dinamiche non stazionarie dell’apprendimento della policy e può portare ad aggiornamenti non ottimali. Proponiamo Dynamic Important Example Mining (DIEM), un framework fondato su principi rigorosi e completamente automatizzato che rende adattivo l’utilizzo dei dati durante tutto l’RFT. DIEM integra in ogni passaggio di ottimizzazione due componenti: (i) uno stimatore dell’importanza basato sull’allineamento dei gradienti, che approssima in modo efficiente il contributo marginale di ciascun campione al miglioramento della policy; e (ii) un metodo di ripesatura dei batch soggetto a vincoli, che massimizza l’utilità complessiva preservando l’ampiezza del gradiente dell’aggiornamento per stabilizzare l’ottimizzazione. Su diversi benchmark di ragionamento, DIEM supera sistematicamente solidi metodi di riferimento sia statici sia dinamici. Il codice sarà reso disponibile all’indirizzo https://github.com/hrtan/DIEM.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv