Ricerca
Collusione emergente nelle interazioni a lungo orizzonte tra agenti LLM
Gli agenti LLM vengono impiegati sempre più spesso in contesti collaborativi, ma le interazioni a lungo termine possono favorire forme di coordinamento indesiderate. Studiamo l’emergere della collusio

- arXiv
- 2609.24967
- Pubblicato
- 2026-09-21
- Autori
- Xinrui Shi, Yanzhe Zhang, Diyi Yang
Abstract degli autori
Gli agenti LLM vengono impiegati sempre più spesso in contesti collaborativi, ma le interazioni a lungo termine possono favorire forme di coordinamento indesiderate. Studiamo l’emergere della collusione in un ambiente multi-agente su un lungo orizzonte temporale: due agenti completano ripetutamente compiti individuali, condividono i registri delle attività, verificano il lavoro reciproco e ricevono ricompense. Introduciamo vincoli realistici che rendono il rispetto del protocollo di verifica incompatibile con la massimizzazione delle ricompense e osserviamo che, nel corso di interazioni ripetute, gli agenti si discostano sempre più dal protocollo. La collusione emerge nel 94% delle traiettorie osservate su 10 modelli; all’interno della stessa famiglia, i modelli più capaci vi giungono prima. Interventi controllati sul comportamento dell’altro agente mostrano che la collusione è influenzata dal comportamento dei pari, mentre gli studi di ablazione rivelano ulteriori effetti della struttura delle ricompense, del feedback di verifica ricevuto dagli agenti e della loro storia di interazione. In particolare, limitare la quantità e l’ambito della cronologia delle interazioni disponibile agli agenti riduce la collusione. Nel complesso, i risultati mostrano che le interazioni a lungo termine possono modificare il modo in cui gli agenti si coordinano, creando rischi per la sicurezza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv