Vai al contenuto
AI.info

Ricerca

SemMSA: analisi robusta del sentiment multimodale con dati incompleti, assistita dalla semantica latente

La ricerca recente sull’analisi multimodale del sentiment (MSA) si è concentrata sull’apprendimento da modalità linguistiche, visive e acustiche con dati incompleti per inferire il sentiment umano. La

SemMSA: analisi robusta del sentiment multimodale con dati incompleti, assistita dalla semantica latente
arXiv
2609.30238
Pubblicato
2026-09-24
Autori
Wenhao Li, Zhibin Wu, Chong Xiao, Qiangchang Wang

Abstract degli autori

La ricerca recente sull’analisi multimodale del sentiment (MSA) si è concentrata sull’apprendimento da modalità linguistiche, visive e acustiche con dati incompleti per inferire il sentiment umano. La maggior parte degli studi compensa in genere le informazioni mancanti ricostruendo le caratteristiche delle modalità o progettando meccanismi di fusione complessi. Tuttavia, questi metodi continuano a risentire di generazioni spurie e indicazioni rumorose, a causa della mancanza di un ancoraggio semantico di alto livello nelle evidenze multimodali osservate solo parzialmente. Per affrontare questi problemi, proponiamo SemMSA, un framework assistito dalla semantica latente che costruisce, con gli LLM, semantiche ricche e pertinenti al sentiment, integrandole pienamente con tutte le modalità attraverso un allineamento spettrale senza ancoraggio. Si compone principalmente di raffinamento semantico cross-modale (CSR) e allineamento spettrale cross-modale (CSA). Nello specifico, il CSR estrae innanzitutto in modo adattivo le rappresentazioni visive e acustiche tramite adattatori corrispondenti, per formare un prefisso multimodale unificato con il linguaggio nello spazio di embedding dell’LLM congelato. Produce quindi iterativamente stati semantici continui e discriminativi attraverso un processo di raffinamento latente efficiente in termini di token, senza decodificare testo esplicito. Il CSA allinea poi simultaneamente le semantiche raffinate a tutte le modalità, potenziando la componente spettrale dominante della loro matrice di Gram del kernel. In questo modo, coglie le dipendenze non lineari globali tra tutte le rappresentazioni, senza basarsi su una modalità di ancoraggio predefinita. Inoltre, un vincolo di separazione spettrale a livello di istanza preserva la discriminabilità tra campioni e mitiga il collasso delle rappresentazioni. Esperimenti estesi sui benchmark SIMS, MOSI e MOSEI dimostrano che SemMSA raggiunge prestazioni allo stato dell’arte.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv