Ricerca
GRASP: generazione, revisione e valutazione per la pianificazione strategica con IA agentica
I modelli linguistici di grandi dimensioni (LLM) mostrano in genere un profilo di prestazioni in cui l’affidabilità diminuisce all’aumentare della complessità del compito. Per affrontare la sfida di g

- arXiv
- 2609.30147
- Pubblicato
- 2026-09-24
- Autori
- Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) mostrano in genere un profilo di prestazioni in cui l’affidabilità diminuisce all’aumentare della complessità del compito. Per affrontare la sfida di generare piani eseguibili in linguaggio naturale di alta qualità per compiti complessi, introduciamo $\textbf{GRASP}$, un framework di pianificazione articolato in più fasi e consapevole delle strategie. GRASP suddivide il flusso di pianificazione in moduli specializzati e con contesti isolati: precompila linee guida macro globali (GenPlan), esplora strategie locali alternative all’interno di finestre di contesto isolate (RevPlan) e valuta in modo indipendente le traiettorie mediante un discriminatore multicriterio (VerPlan). Le valutazioni empiriche mostrano che GRASP definisce con costanza una nuova frontiera dello stato dell’arte su diversi dataset, ottenendo notevoli incrementi di accuratezza rispetto ai pianificatori basati direttamente su LLM in Natural Plan Calendar Scheduling ($\sim$12.4$\%$$\uparrow$), ZebraLogic ($\sim$30.8$\%$$\uparrow$) e SciBench Math. Soprattutto, con l’aumento del numero di compiti — quando i pianificatori standard subiscono un immediato crollo delle prestazioni — GRASP azzera completamente la penalizzazione dovuta al degrado nei contesti multitasking. Negli ambienti con due compiti intercalati, GRASP ottiene un incremento assoluto dell’accuratezza fino a 16.7$\%$ rispetto ai pianificatori basati direttamente su LLM. Inoltre, isolando il contesto e imponendo una rigorosa regolarizzazione macro, GRASP supera i modelli di ragionamento più avanzati (come GPT-5-mini) con un margine del 14.5$\%$.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv