Ricerca
AV-GRPO: apprendimento per rinforzo con diffusione e disaccoppiamento ancorato alla modalità per la generazione congiunta di audio e video
Negli ultimi anni si sono registrati importanti progressi nella generazione congiunta di audio e video. I modelli esistenti continuano a presentare una fedeltà limitata per ciascuna modalità, un allin

- arXiv
- 2609.29816
- Pubblicato
- 2026-09-24
- Autori
- Zhiyu Xu, Weilong Yan, Yufei Shi, Shiyang Li, Yihao Liu, Kin-Man Lam, Yuewen Cao
Abstract degli autori
Negli ultimi anni si sono registrati importanti progressi nella generazione congiunta di audio e video. I modelli esistenti continuano a presentare una fedeltà limitata per ciascuna modalità, un allineamento insufficiente tra testo e modalità e una sincronizzazione debole tra modalità. Sebbene l’addestramento successivo basato sull’apprendimento per rinforzo offra una soluzione promettente, adattarlo direttamente alla generazione congiunta di audio e video è difficile. Le ricompense multimodali eterogenee intrecciano i segnali di apprendimento e complicano l’assegnazione del credito. L’ottimizzazione congiunta delle due torri di modalità è computazionalmente costosa, date le loro dinamiche divergenti. Inoltre, la difficoltà di valutare la sincronizzazione dipende dai campioni accoppiati, impedendo confronti equi tra le ricompense. Proponiamo AV-GRPO, un framework online di RL a diffusione ancorato alla modalità, e 5DAV, un dataset di addestramento disaccoppiato e con difficoltà controllabile. AV-GRPO comprende tre moduli chiave: (1) rollout ancorati alla modalità, per disaccoppiare i segnali di apprendimento e stabilizzare la difficoltà; (2) ottimizzazione con torri congelate e traiettorie bloccate, per ridurre i costi e riassegnare il credito; (3) obiettivi adattivi e intensità delle perturbazioni calibrati sulle dinamiche specifiche di ciascuna modalità. Questo trasforma l’apprendimento congiunto delle preferenze multimodali in sottoproblemi unimodali, consentendo un’attribuzione precisa delle ricompense e una sincronizzazione migliore. Il nostro dataset 5DAV disaccoppia i campioni lungo cinque dimensioni, per un addestramento sistematico. Gli esperimenti su JavisBench e VABench dimostrano che AV-GRPO supera LTX-2.3 per qualità della generazione, allineamento semantico e sincronizzazione tra modalità, sia con LoRA sia con il fine-tuning completo. Gli studi di ablazione confermano le nostre scelte progettuali. Codice e dati: https://github.com/zhiyuxu03/AV-GRPO
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv