Vai al contenuto
AI.info

Ricerca

RelateAnything: predizione in tempo reale delle relazioni a vocabolario aperto da input di qualsiasi tipo

Il rilevamento a vocabolario aperto accetta qualsiasi elenco di classi in fase di inferenza e la segmentazione guidata da prompt restituisce regioni senza nomi di classe: la tassonomia non è più nel m

RelateAnything: predizione in tempo reale delle relazioni a vocabolario aperto da input di qualsiasi tipo
arXiv
2609.12552
Pubblicato
2026-09-11
Autori
Maëlic Neau

Abstract degli autori

Il rilevamento a vocabolario aperto accetta qualsiasi elenco di classi in fase di inferenza e la segmentazione guidata da prompt restituisce regioni senza nomi di classe: la tassonomia non è più nel modello, ma è diventata un input. La predizione delle relazioni no. I modelli di grafi di scena sono ancora addestrati e valutati sui 50 o 56 predicati di un unico schema di annotazione; la loro componente per le relazioni dipende dalle etichette degli oggetti ed è quindi legata a un solo detector. Tre ostacoli lo spiegano, nessuno dei quali riguarda principalmente la modellazione: non esiste un corpus di relazioni che sia al tempo stesso in testo libero e verificato; un’architettura condizionata dalle etichette non può accettare un vocabolario su cui non è stata addestrata; e la metrica standard premia la concordanza con il corpus di addestramento, perciò un vocabolario più ampio risulta un peggioramento. Presentiamo RelateAnything, un modello da 53 milioni di parametri che riceve un’immagine e regioni provenienti da qualsiasi fonte e restituisce relazioni con punteggi per un vocabolario di predicati fornito come stringhe in fase di inferenza. Le etichette degli oggetti non sono mai un input, quindi la fonte delle regioni può cambiare senza riaddestrare il modello, e il vocabolario è un insieme di embedding testuali, non un classificatore appreso. Elabora un fotogramma in 20 ms. L’addestramento su 19.103 predicati richiede una supervisione basata su esempi positivi e non etichettati e un encoder testuale che distingua i contrari, che gli encoder contrastivi rappresentano con una similarità coseno di 0,95. Per fornire questa supervisione, creiamo RA-4M: 474k immagini e 4,3 milioni di relazioni su 10.102 predicati in testo libero, generate a partire da marcatori numerati delle bounding box e verificate geometricamente. Per misurare le prestazioni, creiamo OV-SGG-Bench: sei dimensioni valutate su più dataset, che i bias premiati dalla recall standard non possono soddisfare. Su tre benchmark tra dataset diversi e un quarto zero-shot, RelateAnything ottiene una recall media da 2,3 a 3,5 volte superiore a quella del più forte metodo a vocabolario aperto di scala comparabile, con vantaggi che persistono usando un detector reale, e supera un modello 3B-VLM per grafi di scena su entrambe le metriche con meno del 2% dei suoi parametri. La valutazione nello stesso dominio sovrastima di circa 5 volte i guadagni nel trasferimento. Il modello, il corpus e il benchmark sono pubblici.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv