Ricerca
MiniMax-H3 sa ragionare sul mondo fisico? Una valutazione di un modello generativo omnimodale
I recenti modelli generativi omnimodali (Omni-Models) hanno fatto progredire la generazione di contenuti verso una modellazione unificata di testo, immagini, video e audio. MiniMax-H3 esemplifica ques

- arXiv
- 2609.18323
- Pubblicato
- 2026-09-16
- Autori
- Haoyu Zhao, Zihao Zhao, Tianyu Deng, Ziqin Xu, Zihao Zhang, Xudong Wang, Jinxiang Guo, Chen Gao, Ziyi Ye, Yeying Jin, Jiaxi Gu, Zuxuan Wu, Shuicheng Yan
Abstract degli autori
I recenti modelli generativi omnimodali (Omni-Models) hanno fatto progredire la generazione di contenuti verso una modellazione unificata di testo, immagini, video e audio. MiniMax-H3 esemplifica questa transizione combinando la comprensione del contesto multimodale con la generazione audiovisiva congiunta in una struttura latente condivisa. La sua architettura unificata solleva una questione fondamentale: l’allineamento multimodale può migliorare la capacità del modello di ragionare sul mondo e quali nuovi paradigmi di valutazione rendono possibili gli input omnimodali? Per indagare questa questione, il lavoro presenta un quadro di valutazione completo, articolato in quattro dimensioni complementari del ragionamento sul mondo fisico. A differenza dei quadri di valutazione esistenti per la generazione di video e i modelli del mondo, spesso limitati dalle modalità di input disponibili e da contesti di valutazione in cui i prompt corrispondono strettamente al contenuto del video di destinazione, la nostra valutazione è progettata specificamente per sfruttare gli input multimodali degli Omni-Models. Abbiamo costruito una serie diversificata di nuovi compiti che richiedono ai modelli di integrare informazioni complementari provenienti da modalità diverse. Nello specifico, consideriamo quattro scenari: prompt impliciti abbinati a più fotogrammi, input audio-immagine, prefissi video e input audio-video. Ciascuna modalità fornisce soltanto indizi parziali sull’evento sottostante: il modello deve quindi ragionare congiuntamente sugli indizi semantici complementari per dedurre gli stati latenti dell’evento e le sue dinamiche future. Su 517 casi di valutazione, MiniMax-H3 raggiunge un tasso di successo complessivo del 41,97%. Il ragionamento decisionale basato sui video registra il tasso di successo più alto, pari al 56,00%, mentre il ragionamento di disambiguazione basato sull’audio è il più debole, fermandosi al 27,40%. Questi risultati indicano che un’integrazione multimodale efficace resta fondamentale per sfruttare appieno i vantaggi delle diverse modalità di input. Il progetto è disponibile all’indirizzo https://github.com/gulucaptain/MiniMax-H3-Reason.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv