Vai al contenuto
AI.info

Ricerca

LEAP: recupero appreso delle evidenze per blocchi per la percezione audio-video di lunga durata

La risposta a domande su registrazioni audio-video della durata di ore si scontra con un dilemma legato al contesto: codificare densamente l’intera registrazione esaurisce rapidamente i limiti di cont

LEAP: recupero appreso delle evidenze per blocchi per la percezione audio-video di lunga durata
arXiv
2609.39938
Pubblicato
2026-09-30
Autori
Juyi Lin, Zhiqiang Lao, Jiali Cui, Lin Zhao, Pu Zhao, Dichang Zhang, Arman Akbari, Yu Qi, Xinru Jiang, Yanzhi Wang, Heather Yu, Liang Peng

Abstract degli autori

La risposta a domande su registrazioni audio-video della durata di ore si scontra con un dilemma legato al contesto: codificare densamente l’intera registrazione esaurisce rapidamente i limiti di contesto, mentre una compressione temporale uniforme diluisce fortemente le evidenze acustiche e visive più dettagliate. Presentiamo LEAP, un framework in cui il modello recupera autonomamente le proprie evidenze senza inserire l’intera registrazione in un unico contesto. LEAP divide la registrazione in blocchi di durata fissa e applica a ciascuno un rapido passaggio di localizzazione per assegnare un punteggio a brevi finestre temporali candidate. Le finestre con i punteggi più alti vengono riunite e ricodificate in un unico passaggio di risposta di dimensioni limitate. Di conseguenza, l’input per la risposta e il picco di contesto restano indipendenti dalla durata della registrazione. Separando la localizzazione delle evidenze dal ragionamento, il nostro framework può individuare finestre temporali candidate nelle trascrizioni precalcolate senza decodificare i fotogrammi, preservando al tempo stesso le evidenze visive e sonore non vocali più dettagliate grazie a un passaggio finale di risposta che utilizza i flussi audio-video grezzi. LEAP addestra entrambe le fasi: una LoRA di localizzazione migliora le finestre selezionate e una LoRA di risposta migliora le risposte ricavate dalle stesse finestre. La suddivisione in blocchi supporta nativamente le interrogazioni causali, consentendo a LEAP di effettuare inferenza in streaming senza un addestramento specifico per lo streaming. Su diversi benchmark AVQA, LEAP migliora i risultati della baseline Qwen3-Omni-30B-A3B del 4,5-16,8% e si trasferisce a un secondo modello di base omni-modale, MiniCPM-o 4.5, superandone i risultati pubblicati del 3,1-13,0%.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv