Vai al contenuto
AI.info

Ricerca

Rapporto tecnico su AuK: un modello fondazionale open source per la generazione e l’editing del parlato

Presentiamo AuK, un modello fondazionale open source che unifica la generazione e l’editing del parlato attraverso un’interfaccia comune basata su istruzioni in linguaggio naturale e contesto audio. P

Rapporto tecnico su AuK: un modello fondazionale open source per la generazione e l’editing del parlato
arXiv
2609.08936
Pubblicato
2026-09-08
Autori
Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu, Yanru Huo, Nickk Huang, Yang Liu, Qicong Xie, Zeyu Xie, Hui Wang, Haitao Li, Zixuan Jiang, Yalin Li, Jie Fang, Yifan Duan, Zeyue Tian, Guangzheng Li, Haina Zhu, Shuyi Wang, Jinwen Wang, Mingyu Cui, Tian Tan, Auden, Sen Liang, Steve Yves, Shan Yang, Liefeng Bo, Zilong Zheng, Kai Yu, Eng-Siong Chng, Xie Chen

Abstract degli autori

Presentiamo AuK, un modello fondazionale open source che unifica la generazione e l’editing del parlato attraverso un’interfaccia comune basata su istruzioni in linguaggio naturale e contesto audio. Per supportare questa ampia gamma di capacità, abbiamo creato circa 3,03 miliardi di istanze istruzione-audio e 1,95 milioni di ore di supervisione effettiva per cinque famiglie di compiti: generazione del parlato, editing dei contenuti, miglioramento e separazione, editing paralinguistico ed editing acustico. AuK combina un modello linguistico multimodale di grandi dimensioni per il condizionamento semantico, un VAE addestrato congiuntamente su parlato, audio generale e musica per il condizionamento acustico, e un Transformer ibrido a flusso rettificato che, per la generazione, impiega blocchi MMDiT a doppio flusso seguiti da blocchi DiT unificati a flusso singolo. L’addestramento inizia con una fase preliminare dedicata alla sola generazione e prosegue con il preaddestramento congiunto per generazione ed editing. Applichiamo poi strategie complementari di post-addestramento: l’ottimizzazione delle preferenze basata sul feedback umano per l’editing a risposta aperta e l’apprendimento per rinforzo basato su ricompense per la generazione del parlato. Per ridurre il costo dell’inferenza, distilliamo inoltre il modello mediante inizializzazione per consistenza e Decoupled DMD instradato in base al compito. Il modello risultante, AuK-Flash, esegue l’inferenza in 4 passaggi senza guida priva di classificatore e raggiunge una velocità di esecuzione effettiva 4,5 volte superiore a quella del modello completo, a parità di condizioni. Gli esperimenti mostrano prestazioni ai vertici nella generazione del parlato zero-shot e controllata tramite istruzioni, nonché nell’editing generale guidato da istruzioni, mantenendo al contempo prestazioni competitive nei compiti di ripristino a livello di segnale. Rendiamo disponibili sia il codice sorgente sia i pesi del modello per favorire la riproducibilità e ulteriori ricerche.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv