Vai al contenuto
AI.info

Ricerca

Realtime-Venus: un sistema di interazione full-duplex con delega asincrona

L’interazione naturale negli ambienti digitali e fisici richiede una percezione continua e risposte tempestive. Il dialogo parlato si basa su indizi acustici e linguistici, mentre l’interazione video

Realtime-Venus: un sistema di interazione full-duplex con delega asincrona
arXiv
2609.13814
Pubblicato
2026-09-12
Autori
Ant Group

Abstract degli autori

L’interazione naturale negli ambienti digitali e fisici richiede una percezione continua e risposte tempestive. Il dialogo parlato si basa su indizi acustici e linguistici, mentre l’interazione video richiede anche di ancorare la conversazione a un contesto visivo in evoluzione. Presentiamo Realtime-Venus, un sistema proattivo di interazione full-duplex con due modelli da 9B addestrati separatamente: Realtime-Venus-Omni per l’interazione audio-visiva e Realtime-Venus-Audio per l’interazione parlata. Ciascun modello funge da interfaccia conversazionale completa, integrando percezione continua, controllo della conversazione e generazione nativa del parlato attraverso una cronologia causale condivisa per gli input degli utenti, gli output dei modelli e gli eventi di delega. Un runtime a doppio ciclo coordina l’interazione in tempo reale con il ragionamento in background e l’esecuzione degli strumenti. L’interazione in primo piano prosegue mentre Realtime-Venus-Harness esegue attività in modo asincrono e restituisce i risultati, che vengono integrati nel dialogo in corso. Entrambi i modelli seguono una procedura comune di post-training che combina comprensione offline, traiettorie proattive full-duplex e flussi di lavoro di delega. Tra i modelli online valutati, Realtime-Venus-Omni ottiene i punteggi più alti in sei degli otto benchmark video, tra cui StreamingBench (70,2%), OVO-Bench (64,7%) e Daily-Omni (81,3%). Negli otto benchmark di comprensione audio e risposta a domande orali, Realtime-Venus-Audio supera i modelli confrontati su MMAU (78,0%), MMAU-Pro (63,2%), Llama Questions (83,8%) e Speech CMMLU (67,8%), e pareggia il miglior punteggio di VoiceBench AlpacaEval, pari a 4,81. Su Full-Duplex-Bench v1.5, Realtime-Venus-Audio risponde al 75% delle interruzioni degli utenti e raggiunge tassi di continuazione del 97%, 88% e 86% in presenza, rispettivamente, di segnali di backchannel, parlato rivolto ad altri e parlato in sottofondo, superando Gemini 3.1 Live e GPT-4o su tutte e tre le metriche di continuazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv