Ricerca
Da Pareto alle preferenze: scaling personalizzato in fase di test tramite la scoperta ammortizzata di politiche agentiche
Lo scaling in fase di test (TTS) migliora le capacità di ragionamento dei modelli linguistici di grandi dimensioni destinando più risorse computazionali all’inferenza. Gli approcci esistenti per rende
- arXiv
- 2610.09684
- Pubblicato
- 2026-10-07
- Autori
- Xinglin Wang, Zishen Liu, Tong Zheng, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Kan Li
Abstract degli autori
Lo scaling in fase di test (TTS) migliora le capacità di ragionamento dei modelli linguistici di grandi dimensioni destinando più risorse computazionali all’inferenza. Gli approcci esistenti per rendere il TTS più efficiente ottimizzano perlopiù l’accuratezza rispetto a una sola dimensione delle risorse alla volta, spostando la frontiera di Pareto accuratezza–costo oppure accuratezza–latenza. Le esigenze degli utenti, però, sono multidimensionali: possono riguardare contemporaneamente accuratezza, latenza e costo dell’inferenza, e requisiti diversi possono favorire controller diversi. Formuliamo lo scaling personalizzato in fase di test come la scoperta di controller eseguibili che massimizzano il tasso di soddisfacimento congiunto dei requisiti specifici di ciascun utente. Per ridurre il costo della ripetuta ricerca di politiche per nuovi profili utente, proponiamo PersonTTS, un framework di scoperta ammortizzata di politiche tramite agenti che riutilizza l’esperienza delle ricerche precedenti inizializzando i controller in base alla corrispondenza con i requisiti e fornendo indicazioni procedurali distillate dalle fonti, pur valutando ogni candidato sul profilo di destinazione. Gli esperimenti su AIME e HMMT mostrano che PersonTTS supera nettamente solidi metodi TTS di riferimento nel soddisfacimento congiunto dei requisiti su profili utente mai visti e problemi tenuti da parte. A parità di budget per la valutazione dei candidati, il riutilizzo dell’esperienza acquisita con altri utenti migliora ulteriormente la qualità delle politiche, riducendo sensibilmente il tempo e il costo dell’agente incaricato della scoperta.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv