Vai al contenuto
AI.info

Ricerca

Non rinunciare al dropout: ottimizzare la sparsità degli strati per addestrare gli LLM ed eseguire l’inferenza in modo efficiente

È stato dimostrato che il dropout degli strati, noto anche come profondità stocastica, consente un addestramento più rapido, una maggiore accuratezza e una maggiore robustezza al pruning zero-shot deg

Non rinunciare al dropout: ottimizzare la sparsità degli strati per addestrare gli LLM ed eseguire l’inferenza in modo efficiente
arXiv
2609.05275
Pubblicato
2026-09-04
Autori
Mostafa Elhoushi, Alex Pretko, Nolan Dey, Bin Claire Zhang, Gavia Gray, Gurpreet Gosal, Abdulrahman Mahmoud, Shane Bergsma, Joel Hestness

Abstract degli autori

È stato dimostrato che il dropout degli strati, noto anche come profondità stocastica, consente un addestramento più rapido, una maggiore accuratezza e una maggiore robustezza al pruning zero-shot degli strati sia nei transformer linguistici sia in quelli per la visione. Tuttavia, con la crescita delle dimensioni dei modelli e dei dataset, il dropout — in particolare quello degli strati — è in gran parte scomparso dalle procedure di preaddestramento dei grandi modelli linguistici (LLM). Sebbene alcuni studi precedenti abbiano segnalato che il dropout può ridurre l’accuratezza, nessuno studio esaustivo ha quantificato questo effetto, tanto meno lo ha mitigato. In questo studio mostriamo che il dropout degli strati dovrebbe essere impiegato nell’addestramento degli LLM allo stato dell’arte, definendo le migliori pratiche e un’analisi della scalabilità dei benefici sia durante sia dopo l’addestramento. In particolare, con una distribuzione ottimale tra gli strati, una pianificazione temporale e iperparametri dell’ottimizzatore ottimali, osserviamo che, a parità di FLOP impiegati nell’addestramento, il dropout degli strati produce una loss inferiore. A parità di passi di addestramento, gli LLM possono ottenere una loss di validazione inferiore o simile risparmiando fino al 25% dei FLOP impiegati nell’addestramento. Inoltre, il dropout degli strati consente ottimizzazioni significative dopo l’addestramento, come l’uscita anticipata, il salto degli strati intermedi e la decodifica autospeculativa, con un’accelerazione dell’inferenza fino a 1,5 volte e una perdita di accuratezza trascurabile. Attraverso oltre 2.400 esperimenti di addestramento, su modelli da 271 milioni a 8,2 miliardi di parametri e dataset fino a 160 miliardi di token, dimostriamo che questi risultati si estendono in modo affidabile all’addestramento su larga scala. Tutti gli esperimenti di preaddestramento sono stati eseguiti su sistemi Cerebras CS-3.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv