Vai al contenuto
AI.info

Ricerca

Sharpening Tax nel post-training

Secondo un’ipotesi emergente, il post-training dei modelli linguistici di grandi dimensioni (LLM) tramite apprendimento per rinforzo (RL) non farebbe che affinare i comportamenti già presenti nel mode

Sharpening Tax nel post-training
arXiv
2610.01509
Pubblicato
2026-10-01
Autori
Changdae Oh, Qi Zeng, Qi Qi, Andrey Zhmoginov, Deren Lei, Yun He, Hoang Phan, Hangoo Kang, Azalia Mirhoseini, Sharon Li

Abstract degli autori

Secondo un’ipotesi emergente, il post-training dei modelli linguistici di grandi dimensioni (LLM) tramite apprendimento per rinforzo (RL) non farebbe che affinare i comportamenti già presenti nel modello di base, migliorando l’accuratezza al primo tentativo a scapito della copertura delle soluzioni. Sebbene questo compromesso sia stato osservato nei compiti di matematica e programmazione, non è detto che si estenda ai compiti agentici, nei quali l’uso di strumenti e l’interazione su più turni potrebbero richiedere capacità acquisite solo durante il post-training. Abbiamo riscontrato, a sorpresa, che gli LLM pre-addestrati, dotati di una leggera infrastruttura di supporto all’inferenza, possono fungere da agenti capaci. Pur avendo un’accuratezza molto inferiore (pass@1), spesso superano i corrispondenti modelli sottoposti a post-training nella copertura delle soluzioni (pass@K), se si dispone di un budget sufficiente al momento del test. Analizziamo inoltre il meccanismo sottostante e mostriamo che il post-training spinge i compiti verso due estremi — sempre risolti o mai risolti — migliorando così l’efficienza del campionamento e la coerenza dei risultati a scapito della copertura delle soluzioni. Per misurare questo costo proponiamo Sharpening Tax, una metrica diagnostica che quantifica la perdita di scalabilità al momento del test dopo il post-training. Su 14 coppie di modelli di base e sottoposti a post-training, appartenenti a quattro famiglie, e tre benchmark agentici (42 casi in totale), questo costo si manifesta nella maggior parte delle configurazioni, può essere stimato da poche esecuzioni e mostra una buona correlazione con altre metriche. Presentiamo infine posterior-tempered group sampling (PTGS), un semplice campionatore bayesiano pronto all’uso che adatta la temperatura di campionamento di ciascun prompt alla sua difficoltà stimata. Applicato durante l’addestramento con RL in due ambienti agentici, PTGS comporta un costo inferiore rispetto al metodo di riferimento a temperatura fissa: risolve più compiti con campionamenti ripetuti e migliora anche l’accuratezza al primo tentativo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv