The Pulse
Apple scopre che i modelli insegnanti online migliorano il riconoscimento vocale federato
I ricercatori di Apple riferiscono che la pseudo-etichettatura online può migliorare il riconoscimento vocale federato quando l’addestramento viene stabilizzato con dati etichettati sul server.

AI.info Team ·
I ricercatori di Apple affermano che il riconoscimento vocale federato semi-supervisionato è migliorato quando ogni client partecipante generava etichette di addestramento che si aggiornavano nel tempo e il server tornava a usare un insieme più ristretto di parlato etichettato. Nei risultati riportati in un articolo inviato ad arXiv il 21 settembre, il metodo ha superato il precedente approccio più efficace in 9 delle 11 coppie di dati testate.
Perché le pseudo-etichette possono destabilizzare l’addestramento
Il federated learning consente a dispositivi o client distinti di contribuire all’addestramento di un modello condiviso senza raccogliere i dati grezzi su un server centrale. Nell’impostazione semi-supervisionata studiata dal team di Apple, i dati dei client non contengono trascrizioni fornite da esseri umani, quindi un modello funge da insegnante e genera pseudo-etichette per l’addestramento.
Gli errori nelle trascrizioni generate possono accumularsi sia all’interno di una frase sia nel corso di cicli di addestramento successivi. I ricercatori descrivono questo feedback come una fonte di divergenza, che lascia il federated learning semi-supervisionato indietro rispetto all’addestramento con dati completamente etichettati.
I modelli insegnanti online hanno bisogno di un’ancora sul server
L’articolo confronta diversi modi per generare queste etichette. Un modello insegnante globale resta fisso durante un ciclo di addestramento, mentre un modello insegnante online si evolve su ciascun client man mano che procede l’addestramento locale. Gli autori rilevano che il modello insegnante online può eguagliare o superare quello globale, ma solo se l’addestramento viene stabilizzato con aggiornamenti supervisionati sui dati etichettati del server.
Testano anche un modello insegnante in transizione, che parte dal modello globale e passa agli aggiornamenti online. Man mano che l’insieme iniziale di dati etichettati diventa più consistente, questo approccio eguaglia o supera entrambe le alternative, secondo la sintesi della ricerca di Apple. La scelta del modello insegnante e gli aggiornamenti stabilizzanti del server agiscono insieme; non è possibile valutare l’uno senza l’altro.
Le differenze tra i dati influenzano i risultati
I risultati non sono uniformi tra i dataset vocali. Apple afferma che i miglioramenti dipendono dalla varietà dei dati iniziali e dalla loro sovrapposizione con i dati dei client, e indica l’aumento dei dati sul server e la dimensione del batch tra i fattori che influenzano la stabilità. L’abstract dell’articolo riporta miglioramenti medi del 20,8% all’interno dello stesso dominio e del 10,0% tra domini rispetto al precedente metodo più efficace.
Queste percentuali descrivono i confronti dell’articolo tra coppie di dati, non un miglioramento misurato in un prodotto Apple in commercio. Il lavoro presenta metodi di addestramento e risultati sperimentali; la sintesi della ricerca di Apple non afferma che siano stati implementati in Siri o in un altro servizio per i consumatori.
Un risultato di ricerca, non l’annuncio di un prodotto
Lo studio affronta una tensione pratica: addestrare modelli vocali su audio decentralizzato e non etichettato, limitando al contempo la necessità di raccogliere trascrizioni a livello centrale. I miglioramenti riportati presuppongono che il processo di addestramento resti ancorato a dati etichettati sul server; le impostazioni più adatte dipendono dal rapporto tra il parlato del server e quello dei client.
Nel suo post, Apple indica Wonho Bae, Zakaria Aldeneh, Martin Pelikan, Jan “Honza” Silovsky, Tatiana Likhomanenko e Sheikh Shams Azam come autori dell’articolo. L’articolo è apparso su arXiv il 21 settembre 2026; i risultati restano risultati di ricerca, non prove del lancio di un prodotto.
Gli autori dell’articolo, tra cui Wonho Bae, scrivono:
«I due assi sono inseparabili: le scelte più aggressive del modello insegnante danno risultati solo quando l’ancora stabilizza l’addestramento, che è molto sensibile all’aumento dei dati e alla dimensione del batch: le impostazioni che determinano quanto rumore negli input e nei gradienti il server introduce.»