The Pulse
Apple segnala una compressione di 2,8 volte per un encoder audio in streaming
I ricercatori di Apple descrivono la distillazione di un encoder audio usato da Dictation sul dispositivo: il modello studente ha meno parametri e ottiene risultati vicini a quelli del modello insegnante in cinque delle sei coppie esaminate

AI.info Team ·
Comprimere l’encoder usato da Dictation
I ricercatori di Apple presentano un metodo per comprimere un encoder audio neurale in streaming usato da Dictation a livello di sistema sui dispositivi Apple. Nello studio, l’encoder studente ottenuto tramite distillazione è 2,8 volte più piccolo del modello insegnante. In cinque dei sei confronti tra insegnante e studente, il suo tasso di errore sulle parole (WER) si discosta da quello dell’insegnante di non più dell’1,9% in termini relativi, senza fine-tuning.
L’encoder, che Apple chiama tokenizer, trasforma brevi finestre audio in rappresentazioni lette da un modello di base. Produce un vettore ogni 80 millisecondi di audio. Secondo il paper, il tokenizer e il modello linguistico condividono la memoria: il numero di parametri del tokenizer incide quindi sulla memoria disponibile per il modello, oltre che sui consumi e sulla latenza. La pagina dedicata alla ricerca descrive lo studio; non annuncia l’impiego della tecnologia in un prodotto.
Distillare una rappresentazione condivisa
Invece di addestrare lo studente a riprodurre i token discreti o la distribuzione delle uscite dell’insegnante, i ricercatori usano come obiettivo la rappresentazione dell’insegnante immediatamente precedente alla quantizzazione. Questa rappresentazione latente è condivisa dalle due interfacce per i token descritte nel paper: un’interfaccia discreta, che associa i vettori a indici di un repertorio di codici, e un’interfaccia continua, che proietta i vettori per il modello linguistico. L’encoder studente viene addestrato a far corrispondere la propria rappresentazione a quella dell’insegnante, fotogramma per fotogramma, usando l’errore quadratico. Un livello affine tiene conto della diversa ampiezza delle rappresentazioni dell’insegnante e dello studente.
Durante l’addestramento, il modello insegnante resta invariato: solo l’encoder studente e il livello affine ricevono i gradienti. Lo studente eredita il quantizzatore o il modulo di raccordo dell’insegnante, a seconda dei casi. I ricercatori affermano che il livello affine rappresenta meno dell’1% dell’encoder studente e può essere incorporato nell’interfaccia a valle oppure rimosso per l’inferenza. Segnalano inoltre una riduzione di 2,8 volte del costo delle operazioni di moltiplicazione e accumulo, oltre alla riduzione dei parametri.
Il metodo viene testato in due momenti dell’addestramento del tokenizer: dopo il preaddestramento del solo tokenizer e dopo il suo addestramento congiunto con un modello linguistico. Gli esperimenti usano audio privo di etichette, poiché lo studente apprende dalle attivazioni dell’insegnante anziché dalle trascrizioni. Per la fase di preaddestramento, il WER viene valutato su LibriSpeech, TED-LIUM, VoxPopuli, AMI ed Earnings-22. I test sui modelli addestrati congiuntamente usano un insieme diverso di dati, che comprende LibriSpeech, VoxPopuli, MLS, Common Voice e FLEURS.
I risultati variano nei sei confronti
Tre delle sei coppie insegnante–studente provengono dalla fase di preaddestramento. In questi test, il WER degli studenti ottenuti tramite distillazione si discosta da quello dei rispettivi insegnanti di non più dell’1,9% in termini relativi: uno studente ha un risultato peggiore dello 0,4%, un altro dell’1,9% e il terzo dello 0,8%. In alcuni singoli insiemi di test, gli studenti ottengono anche risultati migliori degli insegnanti.
Gli altri tre confronti riguardano modelli insegnanti addestrati congiuntamente a modelli linguistici, e i risultati sono meno uniformi. Il WER di uno studente si discosta da quello del suo insegnante di non più dell’1,5% in termini relativi. Un altro migliora i risultati dell’insegnante in tutti gli insiemi di test riportati, con un WER medio dell’11,68% contro il 12,33%. L’ultimo studente ha un risultato peggiore del 7,7% in termini relativi, il peggioramento più marcato riportato. È questa l’eccezione al risultato complessivo di cinque confronti su sei.
A parità di capacità, secondo il paper, il tokenizer ottenuto tramite distillazione supera inoltre un tokenizer addestrato in modo indipendente del 3,9% in termini di WER relativo. Gli autori ritengono che questo dimostri un contributo del segnale fornito dall’insegnante che va oltre il semplice impiego di un’architettura più piccola. I risultati riguardano le valutazioni dei modelli di ricerca; non dimostrano che l’encoder compresso sia stato impiegato in Dictation.