Vai al contenuto
AI.info

The Pulse

MLPerf aggiunge test RAG e per agenti edge ai risultati della v6.1

MLPerf Inference v6.1 di MLCommons aggiunge benchmark per pipeline di generazione aumentata dal recupero e per l’inferenza agentica su dispositivi edge.

MLPerf aggiunge test RAG e per agenti edge ai risultati della v6.1

AI.info Team ·

MLCommons amplia MLPerf oltre i test di velocità dei singoli modelli, aggiungendo benchmark per i sistemi a più fasi che oggi gestiscono la generazione aumentata dal recupero e gli agenti sui dispositivi. I risultati di Inference v6.1 dell’organizzazione, pubblicati il 16 settembre, introducono un test RAG end-to-end e un test di inferenza agentica edge, con contributi di un numero record di 30 organizzazioni.

Il cambiamento affronta una discrepanza che si è accentuata man mano che le implementazioni dell’IA sono diventate più complesse. Un benchmark convenzionale per i modelli linguistici può misurare la generazione di token, ma non tiene conto dell’embedding, del recupero, del reranking e della generazione delle risposte in una pipeline RAG, né del contesto sempre più ampio e delle ripetute chiamate agli strumenti in una sessione di programmazione agentica. Ora MLCommons misura questi flussi di lavoro come sistemi integrati, invece che come chiamate isolate ai modelli.

MLCommons ha dichiarato che la release include i primi risultati prestazionali sottoposti a revisione paritaria per diverse piattaforme lanciate di recente o di prossima uscita e mostra miglioramenti fino a 5,7 volte rispetto alle precedenti tornate di benchmark.

La RAG viene testata su tutta la pipeline

Il nuovo benchmark end-to-end di generazione aumentata dal recupero misura due carichi di lavoro correlati. Il primo acquisisce un corpus di documenti e crea un database vettoriale. Il secondo risponde a domande interrogando quel database tramite una pipeline iterativa che recupera passaggi candidati, li riordina e invia le evidenze a uno o più modelli linguistici di grandi dimensioni.

Questa impostazione rende il test sostanzialmente diverso da un benchmark di generazione linguistica. Le prestazioni dipendono dal modo in cui il sistema coordina diversi modelli e servizi, non solo dalla velocità con cui un acceleratore produce token. MLCommons ha introdotto il benchmark ad agosto, descrivendolo come il primo test di inferenza MLPerf a valutare un’intera pipeline RAG, dalla creazione del database alla risposta a domande multi-hop.

«Abbiamo aggiunto il test RAG end-to-end perché è chiaro che la risposta alle domande si è evoluta e non si basa più semplicemente su un LLM addestrato su un corpus; le parti interessate hanno bisogno di capire le prestazioni nel mondo reale dei tipi di pipeline a più fasi e con più componenti che vengono realizzate oggi.»

— Miro Hodak, co-presidente del gruppo di lavoro MLPerf Inference

Gli agenti edge devono fare i conti con vincoli diversi

Il test di inferenza agentica edge affronta un problema distinto: un singolo utente esegue un agente a più turni su un dispositivo con memoria, potenza e capacità di elaborazione limitate. Il carico di lavoro usa il modello Qwen3.6-27B in forma quantizzata e riproduce interazioni di programmazione in cui ogni turno dipende dalla conversazione e dai risultati degli strumenti dei turni precedenti.

MLCommons misura il tempo al primo token, il tempo per token in uscita e la latenza end-to-end per ciascun turno. Il test esegue una richiesta alla volta, invece di misurare il throughput ad alta concorrenza preferito dai sistemi dei data center. Include anche una soglia minima di accuratezza basata sul Berkeley Function Calling Leaderboard v4 e un controllo di correttezza integrato per le sequenze di interazioni di programmazione registrate.

La specifica edge fissa a 32.000 token il contesto elaborato. In questo modo il benchmark può misurare in maniera controllata gli effetti di storici agentici lunghi, senza considerare il limite di memoria di ciascun dispositivo come una condizione di test diversa. Le indicazioni per l’invio dei risultati di MLCommons descrivono un insieme di riferimento per le prestazioni composto da 20 conversazioni e 1.007 turni.

«Allo stesso modo, abbiamo aggiunto il test di inferenza agentica edge perché sistemi di inferenza complessi con caratteristiche agentiche vengono sempre più spesso ospitati su dispositivi di edge computing, creando una nuova serie di sfide prestazionali che i nostri clienti devono affrontare oggi.»

— Miro Hodak, co-presidente del gruppo di lavoro MLPerf Inference

La decodifica speculativa entra in altri test

Inference v6.1 aggiunge anche il supporto alla decodifica speculativa nello scenario interattivo per due benchmark, incluso il compito GPT-OSS. Questa tecnica usa una fase di previsione più rapida per proporre più token prima che un modello più grande li verifichi, consentendo ai sistemi di ridurre parte del ritardo associato alla generazione sequenziale.

La release non presenta questa ottimizzazione come un punteggio principale a sé stante. Aggiunge invece la funzionalità al framework di benchmark esistente, così che chi invia i risultati possa riportare le prestazioni usando un metodo già adottato nei sistemi di inferenza in produzione.

Trenta organizzazioni inviano i risultati

A MLPerf Inference v6.1 partecipano con i propri risultati 30 organizzazioni, tra cui AMD, Cisco, CoreWeave, Dell, Google, Intel, Microsoft Azure, NVIDIA, Oracle, Red Hat e Supermicro. MLCommons indica sei partecipanti alla loro prima tornata: Atlas Inference, Crusoe, Orrick Industries LLC, ScitiX, VibeHPC e il collaboratore individuale Naeem Khoshnevis.

La tornata include cinque nuovi processori o acceleratori: AMD Ryzen AI Max+ 395, AMD Instinct MI350P, Intel Arc Pro B70, NVIDIA Rubin e NVIDIA Vera Rubin NVL72. Gli ultimi due compaiono in sistemi in anteprima, mentre i componenti AMD e Intel sono indicati come disponibili. Una delle partecipazioni usa 512 acceleratori, il sistema più grande mai presentato a MLPerf Inference.

MLCommons segnala anche due configurazioni eterogenee insolite. Una combina reti ad alte prestazioni con acceleratori di due produttori. L’altra distribuisce il sistema su un’area geografica che attraversa l’Oceano Pacifico, estendendo il benchmark oltre una singola macchina o sala di un data center.

I miglioramenti prestazionali si accompagnano a sistemi più complessi

Alcuni risultati selezionati mostrano notevoli miglioramenti rispetto alle tornate precedenti, ma i confronti dipendono dal carico di lavoro e dallo scenario. Il miglior risultato per acceleratore in un sistema server nel test Visual Language Model migliora di 2,99 volte rispetto alla v6.0, pubblicata sei mesi prima. Il miglior risultato per acceleratore in un sistema server per DeepSeek R1 migliora di 5,7 volte rispetto alla v5.1, di un anno prima.

Questi dati misurano il ritmo dei miglioramenti hardware e software all’interno di specifici scenari MLPerf; non significano che ogni implementazione dell’IA sia 5,7 volte più veloce. Il cambiamento più significativo della v6.1 riguarda la varietà dei sistemi misurati: dai singoli acceleratori edge che eseguono un agente interattivo alle grandi installazioni eterogenee che gestiscono pipeline con più modelli.

Frank Han, co-presidente del gruppo di lavoro MLPerf Inference, ha affermato che i risultati offrono ai clienti maggiori informazioni sui «compromessi tra costi e benefici» legati all’acquisto e all’implementazione di sistemi di IA. Più della metà dei partecipanti ha usato il nuovo strumento di test di MLCommons incentrato sulle API, che segue un’architettura client-server basata su API standard ed è pensato per supportare la futura suite MLPerf Endpoints dell’organizzazione.

Secondo MLCommons, MLPerf Endpoints sostituirà infine Inference per i benchmark dei data center. Per la v6.1, lo strumento di test basato sulle API fa già da ponte tra le consolidate tabelle dei risultati del benchmark e il modello di implementazione che l’organizzazione dichiara di voler misurare in seguito.

Fonte

Esplora

Altri articoli