Vai al contenuto
AI.info

Ricerca

Generazione e modifica congiunta e intermodale di video e audio: una formulazione unificata e una tassonomia delle scelte progettuali

Video e audio vengono percepiti insieme, eppure la maggior parte dei modelli generativi li tratta separatamente. Esaminiamo i metodi che modellano congiuntamente le due modalità, ne generano una a par

Generazione e modifica congiunta e intermodale di video e audio: una formulazione unificata e una tassonomia delle scelte progettuali
arXiv
2609.34381
Pubblicato
2026-09-28
Autori
Abhinav Sharma, Sai Karthik Navuluru, Wang Wei, Daksh Dangi, Xiangbo Gao, Li Li, Bo Ni, Vardhan Dongre, Junda Wu, Xiyang Hu, Jiuxiang Gu, Seunghyun Yoon, Tong Yu, Chien Van Nguyen, Mohamed Elmoghany, Nedim Lipka, Hoda Eldardiry, Hongjie Chen, Tyler Derr, Thien Huu Nguyen, Zhengzhong Tu, Nesreen K. Ahmed, Franck Dernoncourt, Ryan A. Rossi

Abstract degli autori

Video e audio vengono percepiti insieme, eppure la maggior parte dei modelli generativi li tratta separatamente. Esaminiamo i metodi che modellano congiuntamente le due modalità, ne generano una a partire dall’altra o le modificano in modo coordinato, organizzandoli attorno a una domanda: come si mantiene la coerenza dell’output tra le modalità, nel tempo e sul piano semantico? Una formulazione unificata presenta la generazione congiunta, la generazione intermodale e la modifica congiunta come tre problemi definiti su un’unica distribuzione di coppie audiovisive; una tassonomia confronta i metodi lungo cinque assi progettuali. Per quanto ne sappiamo, questa è la prima rassegna a classificare sistematicamente la modifica congiunta di audio e video, che suddividiamo in nove categorie comprendenti 28 tipi di modifica. Descriviamo metodi, dataset e metriche per ciascuno scenario e concludiamo con i problemi aperti che riteniamo più rilevanti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv