Vai al contenuto
AI.info

Ricerca

StepAudio 3 Music: rapporto tecnico

Presentiamo StepAudio 3 Music, un modello di generazione musicale su larga scala per brani di lunga durata che supporta la pianificazione musicale esplicita e la generazione controllata tramite testo

StepAudio 3 Music: rapporto tecnico
arXiv
2609.16034
Pubblicato
2026-09-11
Autori
Chengli Feng, Zhiyue Wu, Jiahao Song, Zheqi Dai, Boyang Wang, Ruibin Yuan, Junming Gong, Wenxiao Zhao, Jing Guo, Gang Yu, Xiangyu Zhang, Xuerui Yang, Chao Yan

Abstract degli autori

Presentiamo StepAudio 3 Music, un modello di generazione musicale su larga scala per brani di lunga durata che supporta la pianificazione musicale esplicita e la generazione controllata tramite testo in dominio aperto. StepAudio Music Tokenizer rappresenta l’audio come un flusso a 50 Hz basato su un unico codebook da 65.536 voci, ricorrendo a un addestramento autosupervisionato e multi-task guidato da informazioni semantiche per preservare la struttura musicale e le informazioni rilevanti per la ricostruzione. Un transformer a diffusione con flow matching (DiT) predice le rappresentazioni latenti continue di StepAudio VAE, che il nostro decoder VAE converte in audio a 48 kHz. Questa architettura discreta-continua si basa sul confronto tra VQ con un unico codebook, Semantic and Acoustic RVQ e diverse configurazioni DiT. Per la pianificazione esplicita, un modello autoregressivo Mixture-of-Experts usa la notazione ABC per produrre un piano intermedio di arrangiamento (ABC-CoT) prima di predire i token musicali, integrando armonia, ritmo e struttura melodica nel contesto di generazione. Un percorso di addestramento progressivo e il fine-tuning supervisionato supportano la generazione di canzoni e brani strumentali, la generazione di accompagnamenti a partire da voci senza accompagnamento e la sintesi di cover fino a 5 minuti e 30 secondi. Con l’apprendimento per rinforzo tramite direct preference optimization (DPO), il modello finale ottiene i punteggi più alti per AudioBox Content Enjoyment, Content Usefulness e Production Quality e il valore più alto di similarità MuQ-MuLan tra i sistemi valutati, oltre a risultati competitivi su SongBench. Nella classifica preliminare Artificial Analysis Music Arena Vocals, ottiene un Quality Elo di 1105: è dietro soltanto a Suno V5.5 e Mureka e davanti a Suno V5, ai modelli MiniMax e ad altri sistemi. Dimostrazioni audio sono disponibili all’indirizzo https://stepaudiollm.github.io/step-audio-3-music.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv