Vai al contenuto
AI.info

Ricerca

ENEAS: ensemble neurale guidato dagli embedding per la segmentazione adattiva

Presentiamo ENEAS, un metodo unificato che usa prompt testuali per il tracciamento delle istanze e l’individuazione semantica. I modelli di segmentazione basati su prompt testuali, compresi i più rece

ENEAS: ensemble neurale guidato dagli embedding per la segmentazione adattiva
arXiv
2609.03756
Pubblicato
2026-09-03
Autori
Javier del Pino, Salvador Rodríguez, Alejandro Garabito, Javier Álvarez, Chema Garabito

Abstract degli autori

Presentiamo ENEAS, un metodo unificato che usa prompt testuali per il tracciamento delle istanze e l’individuazione semantica. I modelli di segmentazione basati su prompt testuali, compresi i più recenti foundation model come SAM 3, soffrono ancora di allucinazioni temporali, frammentazione spaziale ed errori di classificazione semantica: non segnalano l’assenza del bersaglio quando un oggetto esce dal campo visivo, segmentano le texture locali anziché l’oggetto intero nei primi piani estremi e danno priorità alle caratteristiche visive rispetto alla realtà ontologica, cosicché artefatti visivamente simili, come statue, dipinti o riflessi, vengono segmentati come entità bersaglio. Con un unico metodo, ENEAS opera in due modi: traccia con precisione e segmenta con alta qualità una singola istanza, oppure individua, per un concetto aperto, tutte le istanze nominate da una query testuale, sottoponendole a un livello di verifica semantica. Per il tracciamento, estendiamo l’architettura SeC, robusta dal punto di vista geometrico e in precedenza limitata alle interazioni tramite punti, con un adattatore per i prompt testuali e sfruttiamo la sua memoria temporale: il bersaglio resta tracciato durante la sua scomparsa, senza che il tracciamento si sposti su elementi di disturbo, e viene segmentato per intero anche quando occupa tutto il campo visivo. Per l’individuazione, il livello di verifica combina un rapido confronto tra embedding visivi con un perfezionamento condizionale tramite VLM, ricorrendo al ragionamento semantico solo per i candidati ambigui. Filtra così gli errori ontologici che i modelli basati soltanto sulle caratteristiche visive non riescono a distinguere, mantenendo bassa la latenza. Progettato pensando alla ricostruzione 3D, nella quale un solo elemento di disturbo classificato erroneamente compromette l’asset, ENEAS rende possibili il tracciamento e la segmentazione semantici di alta qualità di video, di ampie librerie e di raccolte di dati senza un ordine temporale o spaziale, insieme alla capacità di distinguere le istanze autentiche dai loro sosia: cose che si somigliano ma non sono la stessa cosa. Il codice e i modelli sono disponibili all’indirizzo https://github.com/speridlabs/eneas

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv