Vai al contenuto
AI.info

Ricerca

PackLab: un framework completo per sviluppare, addestrare e valutare MLLM nel riempimento robotico di contenitori

Il riempimento robotico di contenitori richiede decisioni sequenziali su orizzonti temporali lunghi, poiché il posizionamento di ciascun oggetto influisce sullo spazio disponibile per quelli successiv

PackLab: un framework completo per sviluppare, addestrare e valutare MLLM nel riempimento robotico di contenitori
arXiv
2609.23784
Pubblicato
2026-09-20
Autori
Donghao Zhou, Jia-Hui Pan, Fan Zhang, Xingyuan Bu, Shilong Li, Xiaojie Gao, Yun-Hui Liu, Chi-Wing Fu, Pheng-Ann Heng

Abstract degli autori

Il riempimento robotico di contenitori richiede decisioni sequenziali su orizzonti temporali lunghi, poiché il posizionamento di ciascun oggetto influisce sullo spazio disponibile per quelli successivi. I metodi esistenti si basano soprattutto su euristiche geometriche artigianali, che ottimizzano obiettivi predefiniti, oppure su politiche di reinforcement learning apprese per tentativi ed errori su configurazioni di addestramento predefinite. Nonostante i recenti progressi dei grandi modelli linguistici multimodali (MLLM) in questo compito, il loro potenziale nel prendere decisioni sequenziali a ciclo chiuso con configurazioni di riempimento eterogenee resta poco esplorato. Per colmare questa lacuna, presentiamo PackLab, un framework completo per sviluppare, addestrare e valutare MLLM destinati al riempimento robotico di contenitori a ciclo chiuso. PackLab-Suite offre una piattaforma di simulazione basata sulla fisica, che consente di generare su larga scala traiettorie di riempimento diversificate per l’addestramento e di valutare i relativi esiti fisici. PackLab-VLM è un MLLM specializzato nel riempimento, capace di comprendere l’evoluzione dello stato degli oggetti e dei contenitori, selezionando congiuntamente gli oggetti e prevedendone il posizionamento in un ciclo chiuso. PackLab-Bench propone scenari di riempimento standardizzati, con diversi livelli di difficoltà, per una valutazione sistematica. Esperimenti approfonditi dimostrano che, in media, PackLab-VLM supera le euristiche convenzionali di riempimento, i metodi tradizionali di reinforcement learning e gli MLLM generalisti su diversi insiemi di oggetti e configurazioni dei contenitori, evidenziando il potenziale degli MLLM nel riempimento robotico su orizzonti temporali lunghi. Il codice, il modello, il dataset e il benchmark sono disponibili all’indirizzo https://github.com/Correr-Zhou/PackLab .

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv