Vai al contenuto
AI.info

Ricerca

Il numero di campioni non basta: la strategia di generazione dei candidati determina il consumo energetico e le prestazioni dello scaling in fase di test dei modelli linguistici di grandi dimensioni

Lo scaling in fase di test può migliorare la capacità di ragionamento dei modelli linguistici di grandi dimensioni generando e combinando più risposte candidate. Nei metodi basati sul campionamento, i

Il numero di campioni non basta: la strategia di generazione dei candidati determina il consumo energetico e le prestazioni dello scaling in fase di test dei modelli linguistici di grandi dimensioni
arXiv
2609.19499
Pubblicato
2026-09-16
Autori
Mobina Kashaniyan, Ali Jannesari

Abstract degli autori

Lo scaling in fase di test può migliorare la capacità di ragionamento dei modelli linguistici di grandi dimensioni generando e combinando più risposte candidate. Nei metodi basati sul campionamento, il budget di inferenza è spesso descritto dal numero di candidati generati, N. Tuttavia, N indica quanti candidati vengono generati, non come viene eseguita la generazione. Lo stesso numero di candidati può essere prodotto con un’unica chiamata di generazione in batch oppure suddiviso tra più chiamate sequenziali con batch più piccoli. Studiamo innanzitutto l’effetto dell’aumento di N sull’accuratezza del ragionamento, usando Phi-3-mini e Qwen2.5-1.5B su 500 prompt GSM8K. Come previsto, portare N da 1 a 8 aumenta l’accuratezza di 8,4 punti percentuali per Phi-3-mini e di 18,4 punti per Qwen2.5-1.5B. L’accuratezza, però, non mostra da sola il costo in termini di risorse di sistema di un maggior numero di candidati. Fissiamo quindi N = 8 e confrontiamo quattro schemi di generazione: 1x8, 2x4, 4x2 e 8x1, dove axb indica a chiamate di generazione con b candidati per chiamata. Misuriamo latenza, throughput, ore-GPU ed energia lorda consumata dalle GPU, mantenendo fisso il numero totale di candidati. Su GPU A100, otto chiamate sequenziali consumano 4,64-4,86 volte l’energia lorda delle GPU e hanno una latenza P95 pari a 5,77-6,12 volte quella di un’unica chiamata in batch con otto candidati. Lo stesso andamento si osserva su tre nodi A100 gestiti in modo indipendente per ciascun modello e negli esperimenti SciQ/V100 con output brevi. Questi risultati mostrano che il solo numero di candidati non basta a descrivere il costo in termini di risorse di sistema dello scaling in fase di test con più candidati. Quando i candidati sono indipendenti e la memoria lo consente, un minor numero di chiamate di generazione con batch più grandi è più efficiente. Le valutazioni dovrebbero quindi riportare non solo il numero di candidati e l’accuratezza, ma anche lo schema di generazione e le metriche di sistema a livello di GPU.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv