Ricerca
VINCIE-NExT: rendere possibile l’editing video a partire dalle immagini con la modellazione in contesto
Realizzare un editor video efficace resta molto più difficile che realizzare un generatore video: l’editing richiede triplette (video originale, istruzione, video modificato) la cui annotazione è proi
- arXiv
- 2610.12104
- Pubblicato
- 2026-10-08
- Autori
- Leigang Qu, Feng Cheng, Ziyan Yang, Bangbang Yang, Zhaoyang Huang, Wei Chow, Yicong Li, Wenjie Wang, Tat-Seng Chua, Yan Zeng
Abstract degli autori
Realizzare un editor video efficace resta molto più difficile che realizzare un generatore video: l’editing richiede triplette (video originale, istruzione, video modificato) la cui annotazione è proibitivamente costosa e la cui sintesi su larga scala è difficile, mentre l’editing delle immagini ha già raggiunto la maturità e dispone di milioni di coppie di questo tipo. In questo lavoro presentiamo VINCIE-NExT, un framework unificato che trasferisce la capacità di editing dalle immagini ai video attraverso dimostrazioni visive fornite nel contesto, riducendo la necessità di grandi quantità di dati appaiati per l’editing video. VINCIE-NExT scompone l’editing video in una catena strutturata di sottocompiti componibili (Video -> Immagine -> Immagine -> Video): fa passare l’intento della modifica attraverso il dominio delle immagini e consente l’addestramento congiunto su larga scala a partire da raccolte eterogenee di immagini e video, con un obiettivo di diffusione unificato. Una coppia di immagini per l’editing, sintetizzata dal modello o fornita dall’utente, viene anteposta come dimostrazione visiva nel contesto e funge da modello di riferimento per l’aspetto spaziale di ogni fotogramma prodotto. Per ancorare le modifiche dell’aspetto all’intero contesto intercalato, introduciamo una nuova codifica posizionale che collega le dimostrazioni basate sulle immagini e i fotogrammi video in un sistema di coordinate spaziali condiviso, consentendo di propagare le modifiche dell’aspetto a ogni fotogramma prodotto con fedeltà a livello di pixel. Chain-of-Editing offre inoltre un metodo fondato per aumentare le risorse di calcolo in fase di inferenza: eseguendo la catena di sottocompiti come fasi progressive di diffusione, si può migliorare la qualità dell’editing impiegando più risorse computazionali senza ripetere l’addestramento. Esperimenti approfonditi su OpenVE-Bench dimostrano prestazioni allo stato dell’arte in diverse categorie di editing, mentre gli studi di ablazione confermano l’efficacia di ciascun componente.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv