Ricerca
OneStreamer: unificare percezione, memoria e risposta proattiva nell’interazione con video in streaming
I LLM per video in streaming devono conservare le evidenze prima che sia nota la loro rilevanza per compiti futuri e rispondere quando diventano disponibili evidenze sufficienti. La sfida è costruire

- arXiv
- 2610.01762
- Pubblicato
- 2026-10-01
- Autori
- Xiangyu Zeng, Yuandong Yang, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Qingyi Si, Dingyu Yao, Changlian Ma, Haoran Chen, Xinyu Chen, Yansong Shi, Junhao Zhou, Yifei Li, Jun Zhang, Chuanyu Qin, Chenxu Yang, Xinlei Yu, Kun Ouyang, Yuchen Shao, Qianshan Wei, Changhai Zhou, Jun Gao, Jiaqi Wang, Limin Wang
Abstract degli autori
I LLM per video in streaming devono conservare le evidenze prima che sia nota la loro rilevanza per compiti futuri e rispondere quando diventano disponibili evidenze sufficienti. La sfida è costruire una memoria fattuale riutilizzabile senza compromettere la percezione in tempo reale. Presentiamo OneStreamer, che apprende congiuntamente a registrare evidenze indipendenti dalle richieste e a rispondere ai compiti attraverso un processo condiviso di generazione proattiva. La sua Proactive Hierarchical Caption Memory (PHCM) produce didascalie ancorate nel tempo che descrivono dettagli locali e riepiloghi degli eventi conclusi. Durante l’addestramento, le didascalie obiettivo per lo streaming supervisionano l’interpretazione delle porzioni di video osservate fino a quel momento. Durante l’inferenza, le registrazioni generate dal modello integrano una finestra visiva recente, fornendo un contesto fattuale riutilizzabile senza dover riesaminare le caratteristiche visive precedenti. Proactive State Transition Learning (PSTL) riduce la predominanza degli stati di attesa ripetuti mantenendo la supervisione in tutti i punti di ancoraggio dell’output e selezionando token rappresentativi dei cambiamenti di stato e della persistenza dello stato. Sviluppiamo inoltre una pipeline di sintesi di dati per lo streaming che allinea il contenuto e i tempi dell’output alle evidenze disponibili. Combinando le didascalie e le coppie domanda-risposta per lo streaming così ottenute con dati open source ripuliti, otteniamo OneStreamer-1M, un dataset ad ampia copertura per l’interazione con video in streaming, con oltre un milione di record relativi a compiti diversi. Il nostro modello da 4B ottiene i risultati migliori tra i metodi confrontati in tutti e otto i benchmark valutati per la comprensione dei video in streaming. Gli studi di ablazione mostrano che conservare le didascalie generate migliora le risposte a domande su eventi passati senza peggiorare la percezione in tempo reale. PSTL supera inoltre la supervisione densa degli stati pur applicando la supervisione soltanto al 27,5% dei token di stato annotati. Nel complesso, questi risultati indicano che la generazione proattiva può fungere da interfaccia di apprendimento condivisa che collega percezione, formazione della memoria e risposta tempestiva nell’interazione con video in streaming.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv