Vai al contenuto
AI.info

Ricerca

GLARE: generazione di volti di ascoltatori con reazioni appropriate

Sebbene la generazione di volti parlanti abbia compiuto rapidi progressi, resta poco esplorata la generazione di comportamenti naturali degli ascoltatori nelle conversazioni a due: quando reagire, com

GLARE: generazione di volti di ascoltatori con reazioni appropriate
arXiv
2609.40317
Pubblicato
2026-09-30
Autori
Zikai Liao, Yumin Suh, Yi Ouyang, Yi-Lun Lee, Yi-Hsuan Tsai, Zhaozheng Yin

Abstract degli autori

Sebbene la generazione di volti parlanti abbia compiuto rapidi progressi, resta poco esplorata la generazione di comportamenti naturali degli ascoltatori nelle conversazioni a due: quando reagire, come farlo e con quale tipo di risposta. I dataset esistenti sulle conversazioni a due non contengono annotazioni dettagliate delle reazioni degli ascoltatori, mentre le metriche di valutazione più diffuse, ereditate dalla generazione di volti parlanti e di video, misurano il realismo visivo anziché l’appropriatezza delle reazioni dell’ascoltatore. Affrontiamo queste lacune su tre fronti. In primo luogo, creiamo un dataset specifico per i volti degli ascoltatori, costruito a partire da RealTalk e Seamless Interaction: comprende circa 147 ore di video con coppie di parlanti e ascoltatori e 64.557 annotazioni di singole reazioni, suddivise in sei categorie: annuire, scuotere la testa, sorridere, ridere, aggrottare le sopracciglia e manifestare sorpresa. In secondo luogo, presentiamo GLARE, un modello di riferimento guidato dall’audio e basato su un transformer con flow matching, con condizionamento prosodico derivato da Qwen2-Audio e una funzione di perdita temporale che supervisiona esplicitamente le reazioni fotogramma per fotogramma. In terzo luogo, proponiamo un protocollo di valutazione incentrato sulle reazioni che misura congiuntamente la presenza delle reazioni (R-F1), il loro allineamento temporale (R-tIoU), la deviazione temporale asimmetrica (R-ATD) e la qualità visiva delle regioni in cui avvengono le reazioni (R-FID), offrendo una valutazione più fondata sul comportamento rispetto alle metriche basate soltanto sulla qualità visiva. I risultati sperimentali mostrano miglioramenti costanti rispetto ai precedenti metodi per la generazione di volti di ascoltatori, sia nella fedeltà visiva sia nelle metriche relative alle reazioni, suggerendo che dati, modelli e valutazioni attenti alle reazioni siano fondamentali per ottenere comportamenti naturali degli ascoltatori.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv