Vai al contenuto
AI.info

Ricerca

Leggi di scaling per i Mixture-of-Experts con cicli

I transformer con cicli e i Mixture-of-Experts (MoE) offrono due strade complementari per aumentare la scala in modo efficiente: la ricorrenza accresce la profondità computazionale a parità di paramet

Leggi di scaling per i Mixture-of-Experts con cicli
arXiv
2609.40316
Pubblicato
2026-09-30
Autori
Yanbei Chen, Anirudh Goyal, Raghuraman Krishnamoorthi

Abstract degli autori

I transformer con cicli e i Mixture-of-Experts (MoE) offrono due strade complementari per aumentare la scala in modo efficiente: la ricorrenza accresce la profondità computazionale a parità di parametri, mentre la sparsità dei MoE aumenta la capacità totale a parità di calcolo attivo. Le leggi di scaling esistenti, però, modellano la ricorrenza o la sparsità separatamente. In questo lavoro presentiamo le Loop Scaling Laws, le prime leggi di scaling a modellare congiuntamente ricorrenza e sparsità, insieme alle dimensioni del modello e ai dati. Il loro elemento centrale è una mappatura limitata della ricorrenza, condizionata alla sparsità, che descrive il guadagno in termini di parametri effettivi ottenuto ripetendo i cicli e il modo in cui la sparsità accresce tale guadagno. Le leggi prevedono la perdita dei modelli con cicli sui dati tenuti da parte con maggiore accuratezza rispetto alle alternative precedenti e ricavano le leggi di scaling standard per i modelli densi e i MoE come casi particolari. Oltre a consentire previsioni, le leggi così stimate forniscono una base fondata su principi per progettare modelli MoE con cicli soggetti a vincoli di calcolo e memoria. Le valutazioni su compiti a valle dimostrano inoltre i vantaggi complementari delle due dimensioni: la sparsità offre un’efficienza in termini di parametri attivi ~3 volte maggiore, la ricorrenza un’efficienza in termini di parametri totali ~2 volte maggiore nei compiti di ragionamento, e la loro combinazione sposta ulteriormente la frontiera delle prestazioni. Come estensione pratica, mostriamo che questi vantaggi si mantengono anche su una scala di mille miliardi di token: a parità di calcolo impiegato per l’addestramento, un MoE con cicli la cui ricorrenza è determinata dalle leggi eguaglia, nei benchmark di ragionamento, un MoE senza cicli ~2 volte più grande, consentendo al contempo di aumentare la scala in fase di test attraverso la ricorrenza.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv