Vai al contenuto
AI.info

Ricerca

La tassazione temporale si aggrava con la compressione post-training dei modelli Whisper

I modelli di riconoscimento automatico del parlato vengono sottoposti a verifiche di equità demografica a precisione piena, ma quelli distribuiti in produzione sono stati quantizzati, potati e distill

La tassazione temporale si aggrava con la compressione post-training dei modelli Whisper
arXiv
2609.28739
Pubblicato
2026-09-25
Autori
Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers, Srinivasan Parthasarathy

Abstract degli autori

I modelli di riconoscimento automatico del parlato vengono sottoposti a verifiche di equità demografica a precisione piena, ma quelli distribuiti in produzione sono stati quantizzati, potati e distillati. Ci chiediamo se la compressione dei pesi dopo l’addestramento, che modifica i pesi del modello anziché il segnale audio o la sua rappresentazione delle caratteristiche, ridistribuisca il carico degli errori tra i gruppi demografici. Nell’intera famiglia Whisper, sui dataset Fair-Speech, Common Voice 25 e AfriSpeech-200, il pruning Wanda al 50% di Whisper-large-v3 amplia nettamente su Fair-Speech il divario di tassazione temporale tra neri/afroamericani e asiatici: il divario assoluto nel tasso di errore sulle parole tra i gruppi serviti peggio e meglio più che raddoppia; ipotizzando un costo di cinque secondi di correzione per ogni errore di trascrizione, il tempo di correzione per ogni minuto di parlato passa da 30 a 64 secondi. Questo aumento relativo del 111% non dipende dal costo ipotizzato per ciascun errore, persiste dopo aver controllato la qualità audio ed è mitigato solo in parte dalla decodifica con beam search, che lascia comunque un aumento dell’86%. Con modelli di dimensioni adatte ai dispositivi edge, la quantizzazione INT4 HQQ moltiplica da cinque a sette volte i loop di trascrizione catastrofici negli accenti dell’Africa occidentale. La distillazione, al contrario, riduce i divari demografici in 21 dei 27 contesti valutati (coppia insegnante-studente, precisione e dataset), con le eccezioni concentrate in una sola coppia di modelli. Formalizziamo il costrutto di tassazione temporale di Choi e Choi (2025) come metrica quantitativa e mostriamo che le verifiche di equità basate su una singola istantanea di modelli a precisione piena non colgono il carico che la compressione impone, al momento della distribuzione, alle persone già marginalizzate.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv