Vai al contenuto
AI.info

Ricerca

ThinkV2V: sprigionare la capacità di ragionamento degli MLLM nella modifica dei video guidata da istruzioni

La modifica dei video guidata da istruzioni ha compiuto notevoli progressi, ma i metodi esistenti usano i modelli linguistici multimodali di grandi dimensioni (MLLM) soprattutto come codificatori sema

ThinkV2V: sprigionare la capacità di ragionamento degli MLLM nella modifica dei video guidata da istruzioni
arXiv
2609.38541
Pubblicato
2026-09-29
Autori
Donghao Zhou, Haoyang He, Fan Zhang, Hao Yang, Guisheng Liu, Xin Gao, Zhongwei Wan, Xingyuan Bu, Jie Wang, Qiangpeng Yang, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

Abstract degli autori

La modifica dei video guidata da istruzioni ha compiuto notevoli progressi, ma i metodi esistenti usano i modelli linguistici multimodali di grandi dimensioni (MLLM) soprattutto come codificatori semantici. Per questo spesso non riescono a gestire modifiche implicite che richiedono un ragionamento causale o semantico. Per colmare questa lacuna fondamentale, proponiamo ThinkV2V, un framework basato sul ragionamento per modifiche video complesse guidate da istruzioni, che attiva esplicitamente il ragionamento degli MLLM prima della generazione visiva. ThinkV2V si basa su una pratica architettura MLLM-to-DiT, che trasforma il ragionamento esplicito sul video originale e sull’istruzione in segnali di condizionamento più precisi per la modifica del video. Lo affianchiamo inoltre a una strategia specifica per l’addestramento e l’inferenza: combina Progressive Curriculum Training, che sviluppa gradualmente le capacità del modello dalle modifiche di base ai casi che richiedono un ragionamento intenso, e Inference-Time Thinking Scaling, che perfeziona iterativamente i prompt candidati e seleziona quello più affidabile, per favorire il ragionamento negli scenari di modifica più impegnativi. Abbiamo anche raccolto il dataset ThinkV2V-150K e introdotto ThinkV2V-Bench per sostenere l’addestramento e la valutazione della modifica dei video in presenza di intenzioni implicite e ragionamento causale. I risultati sperimentali mostrano che ThinkV2V raggiunge prestazioni allo stato dell’arte sia negli scenari di modifica complessi sia in quelli standard: il nostro modello DiT di scala 5B supera nettamente baseline più grandi, di scala 10B.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv