Vai al contenuto
AI.info

Ricerca

$Φ$-Bench: i modelli linguistici di grandi dimensioni possono sviluppare l’infrastruttura che li alimenta?

I modelli linguistici di grandi dimensioni (LLM) hanno dimostrato notevoli capacità di ragionamento e generazione di codice, aprendo la prospettiva che possano contribuire a sviluppare e ottimizzare l

$Φ$-Bench: i modelli linguistici di grandi dimensioni possono sviluppare l’infrastruttura che li alimenta?
arXiv
2609.10226
Pubblicato
2026-09-09
Autori
Leilei Ding, Shumin Wang, Yuting Huang, Fanqi Wan, Yinmin Zhang, Qi Han, Yiming Xu, Feiyuan Zhang, Xiaomeng Chu, Guoliang You, Wuyang Zhang, Daxin Jiang, Yanyong Zhang

Abstract degli autori

I modelli linguistici di grandi dimensioni (LLM) hanno dimostrato notevoli capacità di ragionamento e generazione di codice, aprendo la prospettiva che possano contribuire a sviluppare e ottimizzare la stessa infrastruttura che li alimenta. Tuttavia, i benchmark esistenti si concentrano soprattutto su singoli kernel, operatori predefiniti o obiettivi di ottimizzazione stabiliti in anticipo e, pertanto, non valutano la capacità degli LLM di affrontare attività di ingegneria dell’infrastruttura per LLM a carattere aperto e di lungo respiro. Per colmare questa lacuna, presentiamo $Φ$-Bench, un benchmark per valutare sistematicamente gli LLM nello sviluppo dello stack infrastrutturale per LLM. Basato su problemi di ottimizzazione studiati nella ricerca d’avanguardia e su repository di codice reali, $Φ$-Bench copre ampiamente lo stack infrastrutturale per LLM e comprende attività di diversa complessità, dal completamento localizzato di funzioni a livello di kernel all’implementazione di lungo respiro e all’ottimizzazione end-to-end del sistema. Esperimenti approfonditi su LLM di frontiera ne mettono in luce le capacità e i limiti attuali nello sviluppo di infrastrutture complesse per LLM, offrendo indicazioni sulle sfide ancora da affrontare per arrivare all’ottimizzazione autonoma delle future infrastrutture di IA.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv