Ricerca
Ambient @ EgoProactive 2026: assistenza egocentrica proattiva con supervisione basata su elementi visivi
Presentiamo il nostro contributo alla sezione EgoProactive dell’ECCV 2026 Wearable AI Challenge, che si è classificato primo nella categoria dei modelli di grandi dimensioni e secondo nella categoria

- arXiv
- 2609.07099
- Pubblicato
- 2026-09-07
- Autori
- Logesh Kumar Umapathi
Abstract degli autori
Presentiamo il nostro contributo alla sezione EgoProactive dell’ECCV 2026 Wearable AI Challenge, che si è classificato primo nella categoria dei modelli di grandi dimensioni e secondo nella categoria <=2B. Il compito richiede a un assistente indossabile di decidere, dopo ogni segmento di otto secondi di video egocentrico, se intervenire o rimanere in silenzio. Il nostro approccio ha due componenti principali. In primo luogo, riformuliamo la scelta del momento in cui intervenire come una classificazione basata su un singolo token. Invece di generare $interrupt$<utterance> oppure $silent$, il modello predice yes o no e ricaviamo la decisione dalle probabilità rinormalizzate di questi due token. Rispetto alla generazione in forma libera, questa formulazione ha migliorato la macro-F1 di 0,249 e la G-mean di 0,30. In secondo luogo, poiché i dati etichettati erano limitati al set di validazione rilasciato, abbiamo generato ulteriore supervisione usando un agente video in grado di chiamare strumenti, che esamina ogni clip e assegna le marche temporali degli interventi. Un’alternativa basata sulle sole descrizioni narrative era quattro volte più grande e dieci volte meno costosa, ma si è trasferita meno efficacemente della supervisione proveniente da un corpus reale non correlato. Ciò suggerisce che, per questo compito, l’ancoraggio ai contenuti visivi sia più importante del volume delle annotazioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv