Ricerca
Agente di interazione duplex multimodale
In questo lavoro presentiamo Gander, un modello nativamente multimodale per l’interazione duplex basato su MiniCPM-o 4.5 e ulteriormente adattato all’interazione in tempo reale mediante un ciclo asinc

- arXiv
- 2609.08977
- Pubblicato
- 2026-09-08
- Autori
- Orantqing, Shengpeng Ji, Junlong Tong, Jialong Zuo, Dongjie Fu, Di Cao, Yangzhuo Li, Shangda Wu, Franz, Evan, Theron Veyra, Changhao Pan, Jingyu Lu, Dongchao Yang, Zhifei Xie, Yang Tan, Xiaoyu Shen, Xiaoda Yang, Wenfu Wang, Teddy Sun, Steve Yves, Zhou Zhao
Abstract degli autori
In questo lavoro presentiamo Gander, un modello nativamente multimodale per l’interazione duplex basato su MiniCPM-o 4.5 e ulteriormente adattato all’interazione in tempo reale mediante un ciclo asincrono dell’agente. A differenza dei sistemi convenzionali basati sui turni, Gander elabora continuamente gli input degli utenti trasmessi in streaming, consentendo un’interazione full-duplex sia nelle conversazioni quotidiane sia nei complessi scenari in cui opera un agente. Gli utenti possono interrompere una risposta in corso, mentre il modello può fornire di propria iniziativa riscontri intermedi o porre domande di approfondimento. Per supportare nativamente queste capacità, Gander adotta due scelte architetturali fondamentali: 1) un’architettura collaborativa Cerebellum-Brain, in cui Cerebellum gestisce l’interazione in tempo reale, mentre Brain si occupa del ragionamento complesso e dei compiti agentici di livello superiore. Le due componenti interagiscono continuamente attraverso chiamate agli strumenti e l’ambiente di esecuzione che orchestra l’agente. 2) Cerebellum si basa su un’architettura Thinker-Talker per lo streaming, nella quale gli input degli utenti e gli output del modello sono disposti in un’unica sequenza ordinata di token a livello di blocchi. Valutiamo Gander in termini di capacità conversazionale, capacità di interazione, comprensione ed esecuzione di compiti con l’ausilio di strumenti. Le valutazioni interne condotte da persone mostrano che Gander mantiene un dialogo parlato naturale ed espressivo, mentre i risultati dei benchmark dimostrano un’efficace capacità di alternare i turni di parola e mostrano risultati incoraggianti nelle risposte a domande poste oralmente e nei compiti di comprensione correlati. Gander supporta inoltre diverse situazioni di interazione complesse, tra cui le interferenze dovute al rumore di fondo, le interazioni tra più partecipanti e la comunicazione tramite segnali di ascolto. Sebbene la nostra valutazione attuale si concentri sui contesti che prevedono l’uso di strumenti, i compiti agentici con un orizzonte più lungo e condizioni di impiego più varie restano direzioni promettenti per ulteriori studi. Rendiamo disponibili Gander, i suoi modelli, il codice e i dati per favorire ulteriori attività di ricerca e sviluppo nella comunità.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv