Vai al contenuto
AI.info

Ricerca

La sola deriva dell’instradamento non permette di diagnosticare un malfunzionamento nei grandi modelli linguistici MoE ottenuti per fusione

La fusione dei modelli consente di combinare in modo efficiente grandi modelli linguistici (LLM) specializzati senza riaddestrarli congiuntamente, ma può modificare in misura sostanziale l’instradamen

La sola deriva dell’instradamento non permette di diagnosticare un malfunzionamento nei grandi modelli linguistici MoE ottenuti per fusione
arXiv
2609.32821
Pubblicato
2026-09-26
Autori
Yuanyi Wang, Yanggan Gu, Su Lu, Guanghao Zhu, Pengkai Wang, Yifan Yang, Congkai Xie, Zhaoyi Yan, Jianmin Wu, Hongxia Yang

Abstract degli autori

La fusione dei modelli consente di combinare in modo efficiente grandi modelli linguistici (LLM) specializzati senza riaddestrarli congiuntamente, ma può modificare in misura sostanziale l’instradamento verso gli esperti nei modelli Mixture-of-Experts (MoE). Questa \emph{deriva dell’instradamento} viene spesso interpretata come un malfunzionamento dell’instradamento, ma resta aperta una questione fondamentale: \emph{la deriva dell’instradamento dopo la fusione di modelli MoE indica davvero un malfunzionamento dell’instradamento, e quali prove giustificherebbero un intervento correttivo?} Esaminiamo queste domande su DeepSeekMoE, OLMoE e Qwen3-MoE, proponendo un toolkit per l’analisi dell’instradamento basato su interventi controfattuali controllati e analisi a livello di token. Incrociando gli input e i parametri dei router del modello di origine e di quello risultante dalla fusione, attribuiamo la maggior parte delle riassegnazioni degli esperti a variazioni degli input, anziché a modifiche dei parametri nello stesso livello. Tuttavia, le differenze di instradamento rispetto al modello di origine predicono male i guadagni nella verosimiglianza del token successivo ottenuti ripristinando l’instradamento di origine, e selezioni diverse degli esperti possono produrre output della miscela simili per direzione. Definiamo quindi operativamente il malfunzionamento dell’instradamento come \textit{una perdita sul compito recuperabile mediante uno specifico intervento sull’instradamento, mantenendo fissi i parametri non legati all’instradamento.} Questi test rilevano una perdita recuperabile in presenza di un’alterazione deliberata del router, mentre il ripristino dell’instradamento di origine non dimostra benefici affidabili sui compiti nei modelli ottenuti per fusione che abbiamo valutato. Alla luce di questi risultati, proponiamo \emph{Selective Router Repair (SRR)} come caso di studio e rileviamo che i vantaggi degli specialisti di origine in termini di verosimiglianza dei token non individuano in modo affidabile le correzioni locali vantaggiose. Nel complesso, questi risultati mostrano che \textbf{la sola deriva dell’instradamento non è una prova sufficiente di un malfunzionamento dell’instradamento}: le correzioni basate sul modello di origine devono essere valutate in base agli effetti dei relativi interventi sui compiti. Il toolkit di analisi e il codice di SRR sono stati resi disponibili.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv