Vai al contenuto
AI.info

Ricerca

ShallowStream: indicizzare superficialmente, poi rispondere in profondità per comprendere i video in streaming

La comprensione dei video in streaming è una capacità fondamentale per le applicazioni nel mondo reale, tra cui l’intelligenza incarnata, la guida autonoma, il monitoraggio industriale, la sorveglianz

ShallowStream: indicizzare superficialmente, poi rispondere in profondità per comprendere i video in streaming
arXiv
2609.02780
Pubblicato
2026-09-02
Autori
Jitai Hao, Ke Yang, Qiang Huang, Jun Yu

Abstract degli autori

La comprensione dei video in streaming è una capacità fondamentale per le applicazioni nel mondo reale, tra cui l’intelligenza incarnata, la guida autonoma, il monitoraggio industriale, la sorveglianza e l’allerta precoce e gli assistenti indossabili. Tuttavia, elaborare flussi video continui con modelli linguistici multimodali di grandi dimensioni (MLLM) richiede ingenti risorse di calcolo. I lavori esistenti hanno esplorato diversi modi per ridurre il carico dell’elaborazione in streaming: il pruning dei token visivi, la fusione dei token, la quantizzazione, il recupero dei fotogrammi su richiesta e il trasferimento del contesto. La maggior parte di questi metodi, però, trascura la profondità del modello. Eseguire ripetutamente il prefill di un MLLM a piena profondità sui fotogrammi in arrivo è eccessivamente costoso: comporta un notevole carico computazionale e fa crescere la cache KV a un ritmo direttamente proporzionale alla profondità del prefill. Per affrontare queste difficoltà, proponiamo ShallowStream, un nuovo framework che sfrutta gli strati superficiali di un MLLM per codificare i fotogrammi e costruire contemporaneamente un indice per il recupero. Durante l’elaborazione del flusso, ShallowStream mantiene un indice leggero sempre attivo utilizzando la cache KV degli strati superficiali. Al momento di rispondere a una richiesta, usiamo i punteggi di attenzione generati dagli strati superficiali per assegnare un punteggio ai fotogrammi del contesto e adottiamo una strategia di selezione che tiene conto della diversità per recuperare elementi pertinenti precisi ed esaustivi. ShallowStream raggiunge prestazioni pari a quelle dei metodi esistenti più efficaci per lo streaming, riducendo al contempo la latenza del prefill per fotogramma e la latenza end-to-end su 10 secondi fino a 52,1 e 11,9 volte, rispettivamente. Il nostro codice è disponibile all’indirizzo https://github.com/CURRENTF/ShallowStream.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv