Ricerca
L’agente di buon gusto: misurare e migliorare il gusto nei compiti a lungo termine
Gli agenti basati su LLM lavorano sempre più spesso a compiti a lungo termine, e le decisioni che prendono lungo il percorso, come quale ipotesi verificare o quale implementazione usare come base, det

- arXiv
- 2609.25804
- Pubblicato
- 2026-09-22
- Autori
- Wenbo Pan, Zhichao Liu, Shujie Liu, Jingying Zeng, Chin-Yew Lin, Xianfeng Tang, Yan Lu, Qi He, Xiaohua Jia
Abstract degli autori
Gli agenti basati su LLM lavorano sempre più spesso a compiti a lungo termine, e le decisioni che prendono lungo il percorso, come quale ipotesi verificare o quale implementazione usare come base, determinano l’esito dell’intera esecuzione. Prendere bene queste decisioni sta diventando una capacità fondamentale sia per gli agenti di ingegneria sia per quelli di ricerca. Chiamiamo gusto di un agente la sua capacità di prendere buone decisioni a lungo termine. I benchmark esistenti misurano il successo complessivo degli agenti nei compiti a lungo termine, ma nessuno misura il gusto di un agente. Per affrontare questo problema, abbiamo creato Taste-Bench, un benchmark di quesiti sul gusto costruiti automaticamente a partire dalle traiettorie prodotte dagli agenti in compiti di ingegneria e di ricerca. Ogni quesito presenta un bivio decisionale: un punto della traiettoria in cui sono possibili più direzioni, una delle quali porta a un esito migliore. Il modello valutato sceglie tra queste direzioni senza vedere cosa accade dopo il bivio. Individuiamo automaticamente questi bivi a partire da tentativi paralleli dello stesso compito e da deviazioni all’interno di una singola traiettoria, senza bisogno di annotazioni umane. Valutiamo i modelli di frontiera su Taste-Bench e rileviamo che il migliore risponde correttamente soltanto al 59,7% dei quesiti. Rileviamo inoltre che, per tutti i modelli, i bivi in cui le prove decisive emergono più avanti nella traiettoria sono molto più difficili e che un budget di ragionamento maggiore non migliora la precisione. Infine, mostriamo che il gusto può essere appreso. Distilliamo in un modello allievo il giudizio di un modello insegnante che ha visto l’esito; l’allievo prende decisioni migliori su compiti non visti e migliora il successo complessivo nei compiti SWE-bench Pro tenuti da parte per la valutazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv