Ricerca
Comprensione omni incentrata sul parlato senza addestramento con VLM congelati
La comprensione di audio e video resta una sfida: i modelli devono interpretare insieme il contenuto parlato, gli eventi visivi e le loro relazioni temporali. I modelli omni esistenti introducono di n

- arXiv
- 2609.04242
- Pubblicato
- 2026-08-07
- Autori
- Ankan Deria, Hanoona Rasheed, Xilin He, Fahad Shahbaz Khan, Salman Khan
Abstract degli autori
La comprensione di audio e video resta una sfida: i modelli devono interpretare insieme il contenuto parlato, gli eventi visivi e le loro relazioni temporali. I modelli omni esistenti introducono di norma encoder audio dedicati e richiedono un costoso addestramento su audio, video e testo. Questo lega strettamente le capacità omni a specifici backbone VLM e può indebolire le capacità visive e di ragionamento già presenti. Ne derivano tre domande: l’addestramento omni nativo è necessario per ogni nuovo VLM? È possibile aggiungere capacità omni incentrate sul parlato preservando il backbone originale? E in quali casi restano essenziali rappresentazioni acustiche più ricche? Presentiamo Training-Free Omni (TFO), un framework plug-and-play che trasforma un VLM congelato in un modello omni incentrato sul parlato, senza modifiche architetturali né riallineamento multimodale. TFO usa Whisper per estrarre trascrizioni con indicazioni temporali, filtrate in base al grado di affidabilità, e le instrada attraverso l’interfaccia linguistica esistente del VLM, lasciandone invariato il percorso di elaborazione visiva. In confronti a parità di condizioni con modelli omni nativi su 56 benchmark e in 21 lingue, TFO ottiene risultati competitivi nella comprensione di audio e video, migliora le prestazioni medie nei compiti solo audio in tutte e cinque le configurazioni dei modelli e consegue miglioramenti sostanziali nell’elaborazione del parlato multilingue. Il congelamento del VLM, inoltre, preserva generalmente capacità superiori di comprensione di immagini e video, visual grounding, programmazione, ragionamento matematico e risposta a domande mediche rispetto ai corrispondenti checkpoint omni nativi. Questi risultati mostrano che spesso è possibile ottenere una solida comprensione omni incentrata sul parlato instradando in modo modulare l’audio verso il linguaggio, anziché ricorrere a un costoso addestramento specifico per ciascun backbone.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv