Ricerca
Agenti di programmazione per problemi generalizzati di pianificazione di attività e movimento
I problemi di pianificazione di attività e movimento (TAMP) restano difficili anche con piena osservabilità e stati incentrati sugli oggetti, perché le decisioni discrete sono strettamente legate a vi

- arXiv
- 2609.30233
- Pubblicato
- 2026-09-24
- Autori
- Matteo Merler, Bowen Li, Josh Roy, Yichao Liang, Qianwei Wang, Yixuan Huang, Tom Silver
Abstract degli autori
I problemi di pianificazione di attività e movimento (TAMP) restano difficili anche con piena osservabilità e stati incentrati sugli oggetti, perché le decisioni discrete sono strettamente legate a vincoli geometrici, cinematici e dinamici. La pianificazione TAMP generalizzata affronta questa difficoltà sfruttando regolarità tra diverse istanze del problema, così da ridurre il lavoro di pianificazione su nuove istanze. Tuttavia, i metodi esistenti richiedono una notevole attività di progettazione specifica per il TAMP. Esaminiamo se gli agenti di programmazione possano automatizzare questo processo sintetizzando programmi che si generalizzino a più istanze. Data una descrizione del compito e l’accesso a un simulatore, ogni agente sceglie come interagire con l’ambiente mentre sviluppa un programma entro un budget di sintesi prefissato. Il programma viene quindi congelato e valutato su istanze non viste. Valutiamo Claude Code (Opus 5) e Codex (GPT-5.6 Sol e GPT-6 Astra) in 28 ambienti simulati di KinDER e PDDLStream, con un numero di oggetti superiore a quello valutato nel benchmark originale. Considerando tutti i metodi di sintesi dei programmi, valutiamo 980 programmi generati su 100 istanze ciascuno, per un totale di 98.000 episodi di valutazione. Nel complesso, rileviamo che gli agenti di programmazione sono sorprendentemente efficaci nella pianificazione TAMP generalizzata: tutte e tre le configurazioni degli agenti superano, in termini di successo medio, i pianificatori progettati manualmente, la generazione in un solo passaggio e una baseline di pianificazione generalizzata basata su LLM (dal 56% al 95%, contro il 47% dei pianificatori, nei 16 ambienti per cui è disponibile un pianificatore). All’aumentare del numero di oggetti, i programmi degli agenti mantengono un tasso di successo superiore a quello del pianificatore, utilizzando in media un ordine di grandezza in meno di calcolo per istanza. I log mostrano che gli agenti sfruttano l’interazione per calibrare i modelli fisici, verificare i casi limite e perfezionare le strategie. Rendiamo disponibile tutto il codice, compresi i prompt completi forniti agli agenti. Questi risultati suggeriscono che gli agenti di programmazione costituiscono un solido riferimento per la pianificazione TAMP generalizzata.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv