Ricerca
IntBMoE: integrazione del condizionamento a livello di blocco nella composizione degli esperti per un mixture-of-experts a partecipazione completa
Il Mixture-of-Experts (MoE) aumenta la capacità, ma le architetture esistenti non consentono di regolare indipendentemente tre grandezze. Per un singolo token, la partecipazione indica quanti esperti

- arXiv
- 2609.21346
- Pubblicato
- 2026-09-18
- Autori
- Ran Cheng, Longfei Xu, Zheng Liu, Kaikui Liu, Xiangxiang Chu
Abstract degli autori
Il Mixture-of-Experts (MoE) aumenta la capacità, ma le architetture esistenti non consentono di regolare indipendentemente tre grandezze. Per un singolo token, la partecipazione indica quanti esperti contribuiscono con le proprie conoscenze al suo output; l’esecuzione indica quanti esperti vengono effettivamente calcolati (costo computazionale); la materializzazione indica quanti insiemi di parametri delle dimensioni di un esperto devono essere creati e memorizzati (costo in termini di memoria). Il routing sparso mantiene basse l’esecuzione e la materializzazione, ma riduce la partecipazione: per ogni token contribuiscono solo pochi esperti. La combinazione densa degli output ripristina la partecipazione completa, ma la sua esecuzione cresce con il numero di esperti. La fusione dei parametri limita l’esecuzione a un solo esperto, ma la sua materializzazione cresce con il numero di decisioni di routing. Proponiamo IntBMoE, un MoE condizionato a livello di blocco che separa le tre grandezze abbinando la composizione densa degli esperti all’esecuzione sparsa dei blocchi. I suoi blocchi provengono da un piccolo codebook appreso, uno per ciascuna voce. A ogni livello interno, una hypernetwork leggera fonde tutte le basi degli esperti nell’insieme di quel livello in un unico esperto composto. La partecipazione è completa, perché ogni esperto composto attinge all’intero insieme. L’esecuzione resta sparsa, perché un router indirizza ogni token solo verso pochi blocchi. La materializzazione è limitata, perché è il codebook, non l’input, a fissare il numero di blocchi esistenti. Dual-Path Residual Gating (DPRG) collega inoltre due percorsi composti indipendentemente mediante un meccanismo di gating moltiplicativo. Esperimenti sulla classificazione delle immagini mostrano miglioramenti costanti rispetto a modelli MoE di riferimento rappresentativi, sia sparsi sia densi. Ulteriori esperimenti sulla modellazione del linguaggio e sulla raccomandazione sequenziale ne confermano la capacità di generalizzare oltre l’ambito della visione. IntBMoE è stato interamente messo in produzione nel sistema di raccomandazione generativa di AMap, che serve centinaia di milioni di utenti con un limite di latenza di 60 ms, ottenendo un incremento relativo dell’UVCTR del 2,4% nei test A/B online. Il nostro codice è disponibile all’indirizzo https://github.com/AMAP-ML/DreamX-Rec/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv