Ricerca
Ambient @ EgoLongQA 2026: distillare la percezione di video lunghi in un modello con meno di 2B parametri
Descriviamo il nostro contributo alla traccia EgoLongQA della Wearable-AI Challenge all’ECCV 2026, che si è classificato primo nella categoria <=2B parametri con un punteggio di 0,8279 sul set di test

- arXiv
- 2609.07154
- Pubblicato
- 2026-09-07
- Autori
- Logesh Kumar Umapathi
Abstract degli autori
Descriviamo il nostro contributo alla traccia EgoLongQA della Wearable-AI Challenge all’ECCV 2026, che si è classificato primo nella categoria <=2B parametri con un punteggio di 0,8279 sul set di test tenuto da parte. Il nostro sistema è un unico modello visione-linguaggio da 2B parametri che risponde a domande a scelta multipla su video egocentrici di dieci minuti con un solo passaggio in avanti greedy. Lo abbiamo ottenuto distillando in un piccolo modello studente il modulo junior di percezione di una pipeline agentica che usa strumenti, non l’agente stesso, a partire dalle sole tracce del modello insegnante che hanno prodotto risposte corrette. Raggiunge l’89% dell’accuratezza della grande pipeline agentica usando l’1,1% dei suoi parametri. Sulle nostre domande tenute da parte, questo porta l’accuratezza del modello di base dal 27,1% all’81,4%. Il backbone 2B ha 2,2132B parametri e supera quindi il limite della categoria. Per rendere ammissibile il nostro contributo, riduciamo la tabella degli embedding multilingue da 248.320 a 143.469 righe, arrivando a 1,9985B parametri con logit dimostrabilmente identici per le righe conservate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv