Vai al contenuto
AI.info

Ricerca

Bugie che possiamo vedere: inganno verbale e non verbale congiunto degli agenti VLM nelle interazioni sociali incarnate

L’inganno strategico da parte degli agenti LLM e VLM è diventato una questione centrale per l’allineamento e la sicurezza dell’IA. I giochi di deduzione sociale, in cui ogni giocatore ha un ruolo nasc

Bugie che possiamo vedere: inganno verbale e non verbale congiunto degli agenti VLM nelle interazioni sociali incarnate
arXiv
2608.30428
Pubblicato
2026-08-31
Autori
Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

Abstract degli autori

L’inganno strategico da parte degli agenti LLM e VLM è diventato una questione centrale per l’allineamento e la sicurezza dell’IA. I giochi di deduzione sociale, in cui ogni giocatore ha un ruolo nascosto e comunica con gli altri per dedurne le identità, sono il banco di prova di riferimento, soprattutto nei contesti multiagente. I banchi di prova esistenti, però, sono esclusivamente testuali e funzionano con un’unica configurazione fissa degli agenti: trascurano così i canali sensomotori non verbali considerati centrali dalle tassonomie dell’inganno e lasciano incerto se un comportamento osservato rifletta il modello sottostante o l’infrastruttura che lo circonda. Presentiamo MineAmongUs, un ambiente sperimentale 3D multimodale basato su Among Us in cui gli agenti impostori devono ingannare i membri dell’equipaggio combinando azioni verbali e non verbali. Proponiamo inoltre ARIA, un’infrastruttura configurabile per agenti VLM che consente di effettuare ablazioni lungo cinque assi relativi alle componenti cognitive, e uno schema di annotazione a livello di atomi e archi, fondato sulle tassonomie dell’inganno e applicato su larga scala mediante un LLM-as-a-Judge che raggiunge un grado di concordanza nell’etichettatura degli atomi prossimo a quello umano. I risultati empirici mostrano che gli agenti VLM cercano di far vincere gli impostori attraverso l’inganno verbale e non verbale congiunto; i canali non verbali risultano più determinanti per la vittoria sia nelle ablazioni dell’infrastruttura sia nella valutazione tra diversi VLM. Nel complesso, il nostro lavoro apre una nuova strada per la ricerca sull’allineamento degli agenti VLM incarnati.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv