The Pulse
NVIDIA sostituisce GenAI-Perf con AIPerf per il benchmarking degli LLM
NVIDIA presenta AIPerf come successore di GenAI-Perf, con generazione del carico in più processi, un ampio supporto ai carichi di lavoro e metriche per testare i sistemi di inferenza degli LLM.

AI.info Team ·
NVIDIA volta pagina su GenAI-Perf
NVIDIA ha designato AIPerf come successore di GenAI-Perf, descrivendo il nuovo strumento come una riscrittura dalle fondamenta per il benchmarking dell’inferenza dei modelli linguistici di grandi dimensioni. L’azienda ha annunciato il cambiamento in un post tecnico pubblicato il 18 settembre 2026.
Secondo NVIDIA, i client di benchmark convenzionali possono diventare un fattore limitante quando gli ingegneri testano server di inferenza con concorrenza o frequenze di richiesta elevate. Gli strumenti a processo singolo possono scontrarsi con il Global Interpreter Lock di Python, rendendo più difficile stabilire se le prestazioni misurate riflettano quelle del server o del client che genera il carico di lavoro.
AIPerf utilizza un’architettura multiprocesso. I processi worker generano il traffico, mentre servizi separati elaborano le misurazioni restituite. I componenti sono coordinati tramite ZeroMQ, una scelta progettuale che, secondo NVIDIA, aiuta a impedire che il client di benchmark diventi un collo di bottiglia durante i test del server.
La generazione del carico in più processi punta a risolvere il collo di bottiglia del client
Lo strumento supporta più di 15 tipi di endpoint, tra cui chat, responses, classifiche NIM e generazione di immagini. Supporta anche dataset pubblici come ShareGPT e formati di riproduzione delle tracce di Mooncake, Baseten e WEKA AgentX.
Questa varietà è pensata per coprire sia i test sintetici sia i carichi di lavoro basati sul traffico di produzione registrato. NVIDIA presenta AIPerf come un unico client per rapidi test di verifica, dataset personalizzati e scenari di riproduzione più realistici.
AIPerf offre anche diversi modi per modellare il traffico delle richieste. Supporta modelli di arrivo costanti, di Poisson e gamma, oltre a livelli di burst regolabili e incrementi graduali della concorrenza e della frequenza delle richieste. Le distribuzioni sintetiche possono inoltre variare la lunghezza delle sequenze di input e output, includendo le modalità vLLM e SGLang basate sul rapporto tra gli intervalli per lunghezze variabili delle sequenze di input e output.
Un primo benchmark con vLLM
La dimostrazione di NVIDIA utilizza Qwen3-0.6B, servito tramite vLLM. Il modello è abbastanza piccolo da funzionare su una singola GPU e viene usato per illustrare il flusso di misurazione, non per stabilire un risultato prestazionale specifico del modello.
NVIDIA installa il client con uv tool install aiperf oppure all’interno di un ambiente virtuale. L’esempio esegue quindi un benchmark di chat in streaming con lunghezze fisse di 128 token in input e in output:
aiperf profile \ --model Qwen/Qwen3-0.6B \ --endpoint-type chat \ --streaming \ --url localhost:8000 \ --synthetic-input-tokens-mean 128 \ --synthetic-input-tokens-stddev 0 \ --output-tokens-mean 128 \ --output-tokens-stddev 0 \ --extra-inputs min_tokens:128 \ --extra-inputs ignore_eos:trueIl post afferma che i flag aggiuntivi indicano al modello di generare 128 token invece di fermarsi in anticipo. Senza di essi, il numero di token in output è solo un suggerimento e il modello potrebbe fermarsi ben prima dell’obiettivo.
Lo streaming è necessario per misurare il tempo al primo token e la latenza tra token. Senza streaming, il server invia la risposta completa in un unico blocco, senza eventi relativi al primo token o ai token in fase di decodifica che il client possa misurare.
Metriche e telemetria della GPU
AIPerf riporta il tempo al primo token, la latenza tra token, la latenza delle richieste e il throughput dei token in output. Le metriche comprendono medie, valori minimi e massimi, deviazioni standard e suddivisioni per percentile come p50, p90, p95 e p99.
Lo strumento stampa una tabella delle metriche nella console e salva i risultati completi in formato CSV e JSON. La figura 2 mostra la riga di comando necessaria per ripetere il benchmark e i percorsi dei file di output.
Quando sono disponibili DCGM o pynvml, AIPerf raccoglie anche dati sull’assorbimento di potenza della GPU, sull’utilizzo e sul consumo di memoria. NVIDIA afferma che affiancare queste misurazioni ai risultati di latenza può aiutare a capire se un aumento della latenza è associato alla pressione sulla memoria o a un altro evento a livello del dispositivo.
Il traffico di Poisson mostra l’effetto della contesa
Il secondo esempio di NVIDIA invia una media di 10 richieste al secondo con un modello di arrivo di Poisson. Usa una lunghezza media di input di 512 token con una deviazione standard di 128, una lunghezza media di output di 128 token con una deviazione standard di 32 e un seme casuale fisso per garantire la riproducibilità.
Il modello di Poisson genera intervalli e raffiche, anziché un flusso perfettamente regolare. NVIDIA riporta, nell’esempio, lunghezze di input comprese tra 154 e 818 token e afferma che il carico di lavoro produce una distribuzione più ampia del tempo al primo token rispetto a un’esecuzione con un singolo utente.
La differenza riflette diverse fonti di contesa: più richieste competono per accedere alla GPU, le lunghezze di input variano durante la fase di prefill e le operazioni di prefill e decodifica si sovrappongono. Il caso con concorrenza singola produce un tempo al primo token inferiore, ma a scapito del throughput.
Carichi di lavoro aggiuntivi
NVIDIA afferma che AIPerf supporta anche distribuzioni Kubernetes multinodo, meccanismi di riscaldamento per il riutilizzo della cache KV, la riproduzione di tracce di produzione, la sintesi di prefissi, dataset personalizzati e configurazioni di sweep su diversi livelli di concorrenza. L’azienda indirizza i nuovi utenti al repository, ai tutorial e alla documentazione di AIPerf per ulteriori dettagli sulla configurazione.