The Pulse
Multiverse Computing elimina metà di Llama 3.3 con il 77% a MMLU
Multiverse Computing presenta un metodo basato sulla fisica per rimuovere blocchi transformer dai modelli linguistici di grandi dimensioni. Il suo approccio ottiene il 76,9% a MMLU dopo aver eliminato 40 degli 80 blocchi di Llama 3.3 70B In

AI.info Team ·
Il 21 settembre Multiverse Computing ha pubblicato un nuovo resoconto del suo metodo di potatura dei blocchi, descrivendo come rimuovere metà dei blocchi transformer di Meta’s Llama 3.3 70B Instruct mantenendo un punteggio del 76,9% al benchmark MMLU. Il risultato proviene da un articolo rivisto l’11 settembre e firmato da David Jansen, Roman Rausch, Ali Hashemi, David Montero e Román Orús.
La ricerca affronta la compressione dei modelli come un problema di fisica, anziché come un semplice esercizio di classificazione. Invece di assegnare un punteggio a ciascun blocco transformer indipendentemente e cancellare quelli con la valutazione più bassa, il metodo modella le interazioni tra le decisioni di rimozione. Con una compressione della profondità del 50%, la configurazione selezionata supera di 22,9 punti percentuali a MMLU il metodo di riferimento basato sull’influenza dei blocchi presentato nell’articolo.
L’articolo, «Compressione degli LLM mediante rimozione di blocchi con ottimizzazione binaria vincolata», è accompagnato da una spiegazione dell’azienda su Hugging Face. Gli autori mettono inoltre a disposizione il codice di implementazione tramite un repository pubblico su GitHub.
Perché eliminare blocchi è più difficile che classificarli
Rimuovere interi blocchi transformer riduce la profondità di un modello, il che può diminuire l’uso della memoria e il costo dell’inferenza senza richiedere modifiche alle matrici dei pesi rimanenti. La decisione diventa difficile quando si rimuovono più blocchi insieme: un blocco che da solo sembra sacrificabile può diventare importante quando ne scompare un altro.
La maggior parte delle tecniche di rimozione dei blocchi si basa su misure locali come magnitudine, sensibilità o influenza del blocco. Altre limitano la ricerca a un’unica sequenza consecutiva di livelli. Multiverse Computing sostiene che entrambi gli approcci scartano informazioni sulle interazioni tra i blocchi, soprattutto quando la compressione diventa aggressiva.
I ricercatori assegnano a ciascun blocco una variabile binaria: zero significa che il blocco resta, mentre uno significa che viene rimosso. Introducono quindi un’approssimazione del secondo ordine della perdita del modello e calcolano una matrice hessiana approssimata. I termini diagonali rappresentano gli effetti individuali, mentre quelli fuori diagonale rappresentano le interazioni a coppie tra le decisioni di rimozione.
Un vetro di Ising per la compressione dei modelli
Il problema risultante di ottimizzazione binaria vincolata cerca un numero fisso di blocchi la cui rimozione produca l’energia stimata più bassa. Gli autori riconducono il problema a un vetro di Ising, un modello fisico in cui numerose variabili binarie interagiscono all’interno di un sistema.
Questo calcolo dell’energia è molto meno costoso dell’esecuzione di un benchmark completo per ogni possibile schema di potatura. Il team calcola la matrice hessiana con passaggi in avanti e all’indietro su un insieme di calibrazione, poi la riutilizza per diversi livelli di compressione. Per gli esperimenti, i dati di calibrazione comprendevano 2.048 campioni estratti casualmente da OpenHermes-2.5.
L’enumerazione esatta resta possibile per alcuni modelli, ma la sua complessità cresce rapidamente. L’articolo afferma che verificare le circa 29 miliardi di configurazioni ottenute rimuovendo otto degli 80 blocchi di Llama 3.3 70B Instruct ha richiesto circa due giorni su una singola GPU. Per le ricerche più ampie, gli autori utilizzano approcci euristici, tra cui un risolutore tabu open source che può produrre in pochi secondi candidati a bassa energia.
Gli 80 blocchi di Llama mettono in luce il divario
Llama 3.3 70B Instruct ha 80 blocchi transformer e, nella valutazione riportata, ha ottenuto l’82,2% a MMLU prima della compressione. Rimuovendo 32 blocchi, il metodo di ottimizzazione binaria vincolata ha ottenuto il 76,6%, contro il 59,3% del metodo di riferimento basato sull’influenza dei blocchi.
Nel test più estremo, il metodo ha rimosso 40 degli 80 blocchi e ottenuto il 76,9% a MMLU. Il metodo basato sull’influenza dei blocchi è sceso al 54,0%. Con una profondità ridotta del 50%, il metodo vincolato ha superato il metodo di riferimento anche su HellaSwag, Winogrande, ARC Challenge e BBH, sebbene nella prova riportata il suo punteggio a GSM8K fosse zero.
Il vantaggio non è universale. Ai livelli di compressione più contenuti, il metodo ottiene in genere risultati in linea con le tecniche concorrenti. L’articolo riporta risultati simili su Llama 3.1 8B Instruct e Qwen3 14B, con alcune configurazioni valutate dopo un’epoca di riaddestramento con distillazione della conoscenza.
La risposta migliore potrebbe non essere quella a energia più bassa
Una delle conclusioni più insolite dell’articolo è che la configurazione a energia più bassa non sempre dà il modello più efficace. I ricercatori esaminano diverse soluzioni a bassa energia, compresi stati eccitati al di sopra dello stato fondamentale, e scoprono che alcune ottengono risultati migliori dopo il riaddestramento.
Per Llama 3.1 8B Instruct, i candidati a energia più bassa tendevano a rimuovere blocchi verso la fine del modello. Un candidato a energia più alta che rimuoveva un blocco più iniziale ha prodotto risultati migliori su diversi benchmark dopo un leggero riaddestramento. Questa osservazione mette in discussione l’idea che una potatura efficace debba rimuovere un’unica sezione ininterrotta di livelli finali o intermedi.
Una rosa più ampia di candidati cambia anche il modo in cui i professionisti potrebbero valutare la compressione. Invece di considerare l’ottimizzazione come una ricerca di un unico schema di potatura definitivo, il metodo produce una serie di configurazioni che possono essere testate in base a diversi requisiti di accuratezza, velocità e riaddestramento.
Test del metodo sull’architettura ibrida di Nemotron
Multiverse Computing applica il metodo anche a Nemotron-3-Nano-30B-A3B-FP8 di NVIDIA, un modello ibrido con 52 blocchi che combina livelli Mamba2, livelli di attenzione e livelli mixture-of-experts. I blocchi sono disposti in una struttura non uniforme, che rende meno adatte le semplici strategie di classificazione dei livelli.
Senza riaddestramento, alcune configurazioni selezionate, che rimuovevano due o tre livelli mixture-of-experts, hanno superato il metodo di riferimento basato sull’influenza dei blocchi su AIME25 o GPQA, a seconda della configurazione. In una valutazione più ampia, una configurazione che rimuoveva due livelli MoE ha ottenuto l’85,0% ad AIME25 e il 69,5% a GPQA, contro il 65,0% e il 70,1% della configurazione di riferimento.
L’articolo non dimostra che si possa rimuovere qualsiasi blocco senza rischi. I risultati mostrano forti variazioni tra le configurazioni candidate, soprattutto nei test di ragionamento matematico. Il contributo consiste in un modo per mettere in luce e cercare queste differenze prima di investire le maggiori risorse necessarie per il riaddestramento e la valutazione completa.