Vai al contenuto
AI.info

Ricerca

Apprendimento di policy guidato dai prior degli agenti

I robot che imparano da poche dimostrazioni hanno spesso bisogno di due forme di generalizzazione. La generalizzazione composizionale ricombina le abilità per risolvere nuovi compiti; la generalizzazi

Apprendimento di policy guidato dai prior degli agenti
arXiv
2609.35690
Pubblicato
2026-09-28
Autori
Puming Jiang, Tianrun Hu, Haozhe Du, Yibo Li, Zhiwei Xue, Xinhu Li, Harold Soh

Abstract degli autori

I robot che imparano da poche dimostrazioni hanno spesso bisogno di due forme di generalizzazione. La generalizzazione composizionale ricombina le abilità per risolvere nuovi compiti; la generalizzazione delle abilità permette invece alla policy appresa per ciascuna abilità di funzionare in situazioni nuove. Le due forme dipendono l’una dall’altra, eppure nel passaggio dalla composizione alle abilità che essa richiama si perdono informazioni. Le situazioni in cui un’abilità funziona dipendono dalla struttura con cui viene addestrata la sua policy, mentre la composizione vede l’abilità solo attraverso una descrizione separata, come un nome, un’istruzione o un operatore simbolico, che omette tale struttura. La nostra idea centrale è usare il prior strutturale di ciascuna policy come parte dell’interfaccia tra la composizione e l’abilità. Un prior strutturale specifica da cosa dipende un comportamento: per esempio, che una presa dipende solo dalla posa della pinza rispetto all’oggetto. Integrato nell’addestramento, determina in quali situazioni la policy riesce a generalizzare; espresso a parole, indica alla composizione dove la policy è applicabile. Realizziamo questa idea in Agent Priors-guided Policy Learning (APPL). Un agente di costruzione suddivide dimostrazioni complete in abilità riutilizzabili, propone diversi prior strutturali per ciascuna abilità e addestra e verifica una policy per ogni prior. Un agente in fase di esecuzione seleziona poi tra queste policy specifiche per ciascun prior e le compone, usando le loro interfacce, per raggiungere gli obiettivi di nuovi compiti. Nei test su MetaWorld e sui compiti a lungo orizzonte di ManiSkill, APPL migliora la generalizzazione delle abilità fuori distribuzione e rende possibili composizioni di abilità mai viste prima; eliminare le informazioni delle interfacce riduce sensibilmente le prestazioni. Questi risultati sostengono l’uso delle assunzioni strutturali adottate durante l’addestramento come ponte tra l’apprendimento e la composizione delle abilità.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv