Ricerca
Ripensare la valutazione automatica della somiglianza vocale: dall’EER alla geometria degli embedding
Si presume comunemente che i modelli di verifica del parlante (SV) colgano meglio le sfumature delle caratteristiche dei parlanti man mano che migliora la loro accuratezza nella verifica. Per questo v

- arXiv
- 2609.33999
- Pubblicato
- 2026-09-27
- Autori
- Szu-Chi Chen, Jia-Kai Dong, Yi-Cheng Lin, Sung-Feng Huang, Hung-yi Lee
Abstract degli autori
Si presume comunemente che i modelli di verifica del parlante (SV) colgano meglio le sfumature delle caratteristiche dei parlanti man mano che migliora la loro accuratezza nella verifica. Per questo vengono ampiamente usati come sostituti automatici del giudizio umano sulla somiglianza vocale nei compiti di generazione del parlato. Tuttavia, definendo una metrica di allineamento con la percezione umana e conducendo un’analisi sistematica, dimostriamo che l’allineamento percettivo dipende molto più da come un modello viene addestrato (il suo obiettivo di apprendimento) che dalle sue prestazioni (EER). In particolare, le funzioni di perdita standard per la classificazione basate sul margine (per esempio AAM-Softmax) producono un allineamento percettivo nettamente inferiore rispetto alle funzioni di perdita metriche prototipiche, mentre l’EER, di per sé, non rispecchia il giudizio umano. Questo mette direttamente in discussione un assunto implicito della comunità scientifica. Riconduciamo questa divergenza alla geometria degli embedding: la dimensionalità effettiva di un modello ($d_{\mathrm{eff}}$) segue l’allineamento percettivo con una correlazione di rango pari a $-0.95$. Ciò rivela che la dispersione su più dimensioni favorita dalle funzioni di perdita per la classificazione è fondamentalmente in contrasto con la natura a bassa dimensionalità della percezione umana della voce. L’imposizione di un collo di bottiglia dimensionale riduce $d_{\mathrm{eff}}$ e aumenta l’allineamento percettivo ($ρ_{\mathrm{align}}$) da 0,08 a 0,74, stabilendo un criterio geometrico fondato su principi per valutare la somiglianza vocale.