Vai al contenuto
AI.info

Ricerca

Rapporto tecnico su StepAudio 3 Gen

Presentiamo StepAudio 3 Gen, un modello di generazione audio per uso generale che supporta la sintesi vocale da testo (TTS) zero-shot, la progettazione delle voci, la generazione di parti vocali, effe

Rapporto tecnico su StepAudio 3 Gen
arXiv
2609.12945
Pubblicato
2026-09-11
Autori
Bin Lin, Bo Zhao, Boyang Wang, Boyang Zhang, Boyong Wu, Chao Yan, Chen Geng, Chen Wu, Cheng Yi, Chengli Feng, Chenglin Zhu, DanNi Wan, Daxin Jiang, Dongqing Pang, Fei Tian, Feng Tian, Future Li, Gang Yu, Guanglong Yang, Jia Peng, Jiahao Song, Jiamin Fan, Jiangjie Zhen, Jianzheng Gao, Jun Chen, Li Xie, Lifang Zhang, Lingli Ji, Liying Shi, Lun Cai, Min Xu, Na Wang, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Ruijie Xiong, Runze Li, Shenghua Hu, Shi Qiu, Siqi Tu, Siyi Zhou, Tianjiao Deng, Wanying Lu, Weiming Niu, Wen Sun, WenWen Qu, Xiangyu Zhang, Xianwei Zhang, XiaoSu Su, Xing Chen, Xinyu Liu, Xuerui Yang, Yang Li, Yang Yang, Yechang Huang, Yibo Zhu, Yifan Zhang, Yiyang Xu, Yu Fu, Yu Luo, Yu Zhou, Yumang Wang, Yunzhou Ju, Yuxiang Yang, Zekai Liu, Zengwei Yao, Zhenwei Mou, Zheqi Dai, Zhiyue Wu, Zichao Zhou

Abstract degli autori

Presentiamo StepAudio 3 Gen, un modello di generazione audio per uso generale che supporta la sintesi vocale da testo (TTS) zero-shot, la progettazione delle voci, la generazione di parti vocali, effetti sonori, musica, parlato d’atmosfera e combinazioni di più tipi di audio in un’unica architettura. StepAudio 3 Gen è fondamentalmente un generatore autoregressivo discreto che modella l’audio direttamente sui token della quantizzazione vettoriale residua (RVQ), discostandosi dal paradigma di generazione continua basato su Transformer a diffusione, prevalente nei recenti modelli audio per uso generale. Il suo StepAudio Tokenizer rappresenta l’audio per uso generale a 12,5 Hz in uno spazio condiviso di codici residui $16 \times 2048$, quantizzando congiuntamente le caratteristiche semantiche e quelle acustiche a livello di forma d’onda, così che ogni livello di codici conservi entrambi i tipi di informazione. Nella generazione, il modello principale predice il primo codebook lungo l’asse temporale mediante modellazione autoregressiva, mentre un Transformer causale leggero completa i restanti quindici codebook lungo l’asse dei codebook. Il nostro studio individua inoltre tre principi progettuali fondamentali: (1) un preaddestramento progressivo che tiene conto delle interferenze, per acquisire capacità audio preservando le capacità testuali del modello linguistico di grandi dimensioni, (2) RVQ Adaptor, per integrare efficacemente rappresentazioni acustiche basate su più codebook, e (3) la modellazione autoregressiva discreta su una rappresentazione condivisa tra i diversi ambiti dell’audio per uso generale. Grazie al preaddestramento progressivo, all’addestramento multi-task su istruzioni e al fine-tuning supervisionato, StepAudio 3 Gen raggiunge prestazioni allo stato dell’arte sia nella TTS sia nella progettazione delle voci, mantenendo elevate capacità di generazione di parlato, parti vocali, effetti sonori e musica. Esempi audio sono disponibili all’indirizzo https://stepaudiollm.github.io/step-audio-3-gen/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv