Vai al contenuto
AI.info

Ricerca

Ovis-Embedding: oltre i confini degli embedding multimodali universali

In questo report presentiamo \textbf{Ovis-Embedding}, una famiglia di embedding multimodali universali all’avanguardia, basata sull’integrazione nativa di testo, immagini, video e audio. Invece di ass

Ovis-Embedding: oltre i confini degli embedding multimodali universali
arXiv
2609.25165
Pubblicato
2026-09-21
Autori
Ovis-Embedding Team

Abstract degli autori

In questo report presentiamo \textbf{Ovis-Embedding}, una famiglia di embedding multimodali universali all’avanguardia, basata sull’integrazione nativa di testo, immagini, video e audio. Invece di assemblare torri separate per ciascuna modalità, Ovis-Embedding usa un backbone multimodale condiviso per codificare modalità diverse in uno spazio di rappresentazione comune. In particolare, introduciamo \textbf{tre progressi chiave}: (1) \textbf{inizializzazione multimodale universale nativa}: adottiamo un modello Qwen-omni preaddestrato come backbone per gli embedding e lo adattiamo tramite addestramento contrastivo con inizializzazione a basso rango; (2) \textbf{addestramento multimodale universale incentrato sui dati}: costruiamo un corpus ampio e di alta qualità, che comprende testo, immagini, video, audio e dati multimodali intercalati. Per migliorare l’efficienza nell’uso dei dati, introduciamo il campionamento da fonti omogenee, che permette di formare batch coerenti con il compito e con esempi negativi informativi all’interno del batch; e (3) \textbf{ottimizzazione dell’addestramento e dell’inferenza specifica per gli embedding}: usiamo la focal loss per dare maggiore peso agli esempi difficili e la Embedding Distillation basata sulla similarità per trasferire la struttura di similarità dettagliata da esperti complementari. In fase di inferenza, la decomposizione delle feature a basso rango consente di ottenere embedding compatti con dimensionalità flessibile e perdite di prestazioni minime. Le valutazioni empiriche mostrano che la famiglia \textbf{Ovis-Embedding} raggiunge prestazioni all’avanguardia su \textbf{MMEB-v3}, \textbf{MMEB-v2}, \textbf{MVEB}, \textbf{MAEB} e \textbf{RTEB}, dimostrando la propria efficacia con modalità testuali, visive, video e audio. Questi risultati evidenziano il potenziale dell’addestramento multimodale universale unificato nel superare la frammentazione tra modalità e nel far progredire i modelli di embedding universali per il recupero da qualsiasi modalità a qualsiasi altra.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv