Vai al contenuto
AI.info

Ricerca

YuE2: generazione musicale simbolica e audio unificate con una qualità ai massimi livelli

I modelli simbolici rendono espliciti melodia, armonia, ritmo e forma, ma in genere si fermano prima di arrivare a una registrazione finita; i modelli audio producono brani completi, lasciando però im

YuE2: generazione musicale simbolica e audio unificate con una qualità ai massimi livelli
arXiv
2609.33757
Pubblicato
2026-09-27
Autori
Ruibin Yuan, Jiahao Pan, Junyan Jiang, Zhiyue Wu, Ziya Zhou, Jiankai Sun, Yizhi Li, Ge Zhang, Yicheng Gu, Zeyue Tian, Junyu Dai, Hanfeng Lin, Kai Li, Shangda Wu, Xuanjie Liu, Jiaming Wang, Zihan Liu, Yue Wang, Yinghao Ma, Hanzhi Yin, Kangrui Chen, Xinyue Zhang, Ziyang Ma, Mengqi Liao, Hejia Zhao, Guowei Huang, Chao Yan, Lei Ke, Jianwei Yu, Bei Liu, Joe Guo, Liumeng Xue, Gus Xia, Wei Xue, Yike Guo

Abstract degli autori

I modelli simbolici rendono espliciti melodia, armonia, ritmo e forma, ma in genere si fermano prima di arrivare a una registrazione finita; i modelli audio producono brani completi, lasciando però implicita la composizione. Presentiamo YuE2, che unifica la generazione musicale simbolica e audio con una qualità ai massimi livelli grazie alla pianificazione simbolica. Un unico AR-NAR Mixture-of-Transformers (MoT) scrive dapprima uno spartito leggibile che specifica melodia e armonia, poi lo sviluppa in token musicali semantici e infine lo realizza come audio di un brano completo. Nei confronti effettuati usando lo stesso checkpoint, gli esperti preferiscono la pianificazione simbolica per qualità complessiva e musicalità: raccoglie il 49,3% delle preferenze complessive, contro il 34,6% della versione senza pianificazione. Gli esperti preferiscono inoltre il modello unificato alla combinazione di un modello linguistico separato e un Transformer a diffusione. Su WildSongBench, YuE2 ottiene 6,73 in SongBench Global Avg, superando tutti i modelli di riferimento pubblici valutati. Selezionando il risultato tra otto candidati (best-of-8), YuE2 raggiunge 6,96, la media osservata più alta fra tutti i sistemi valutati. L’ascolto da parte degli esperti ne conferma inoltre la competitività rispetto ai generatori di canzoni proprietari: preferiscono il risultato best-of-8 a Suno v4.5, mentre le preferenze rispetto a Suno v5 sono quasi equilibrate. Per apprendere questo processo di generazione dalle registrazioni senza disporre di spartiti allineati, introduciamo MERT2 e SheetSage2, che forniscono supervisione semantica e simbolica. MERT2 stabilisce un nuovo stato dell’arte nell’apprendimento di rappresentazioni musicali, superando i migliori risultati precedenti in 14 delle 15 metriche MARBLE; SheetSage2 è in testa in 12 delle 15 coppie benchmark-metrica del nostro confronto sulla trascrizione di lead sheet. Lo stesso checkpoint recepisce le modifiche allo spartito preservando in larga misura il contenuto musicale non modificato e genera cover zero-shot senza un addestramento specifico per le cover. Il suo spartito leggibile consente anche la modifica agentica della musica, con modelli linguistici esterni che traducono i feedback degli utenti in revisioni della composizione.

Leggi il paper originale su arXiv