Vai al contenuto
AI.info

The Pulse

ProgramDistill crea 4.063 attività di programmazione a partire da 26 applicazioni web funzionanti

Un nuovo benchmark, chiamato ProgramDistill, trasforma il comportamento di applicazioni web funzionanti in attività di programmazione pensate per verificare se gli agenti riescono a ricostruire funzionalità attraverso l’interazione, anziché

ProgramDistill crea 4.063 attività di programmazione a partire da 26 applicazioni web funzionanti

AI.info Team ·

Un nuovo benchmark, chiamato ProgramDistill, trasforma il comportamento di applicazioni web funzionanti in attività di programmazione pensate per verificare se gli agenti riescono a ricostruire funzionalità attraverso l’interazione, anziché basandosi sul codice sorgente, sulle descrizioni dei problemi o su istruzioni scritte.

Il paper, inviato ad arXiv il 16 settembre 2026, descrive uno scenario in cui un agente di programmazione deve dedurre il comportamento di un’applicazione di riferimento pienamente funzionante e implementare quei comportamenti in un’applicazione incompleta. Il benchmark si concentra su attività software pratiche, in cui il risultato desiderato può essere visibile in un prodotto funzionante, ma non è descritto completamente a parole.

Applicazioni funzionanti come specifiche

ProgramDistill scompone le applicazioni in funzionalità con diversi livelli di granularità. Ogni funzionalità è collegata a un comportamento riproducibile, che può essere eseguito sull’applicazione di riferimento e confrontato con il risultato prodotto dall’implementazione di un agente.

La pipeline mine-craft-patch del benchmark individua i comportamenti interagendo con applicazioni pienamente funzionanti, quindi crea attività di riparazione senza intervento umano. Le attività risultanti sono pensate per fornire test eseguibili che verifichino se un agente ha riprodotto il comportamento desiderato, anziché limitarsi a produrre codice che sembra plausibile.

Questo approccio cambia il punto di partenza per la valutazione dell’ingegneria del software. Invece di ricevere la descrizione di un bug o di una funzionalità richiesta, un agente deve esaminare un prodotto funzionante, dedurre quale comportamento è importante e riprodurlo in un altro stato dell’applicazione.

Oltre 4.000 attività

Il paper riferisce che la pipeline ha individuato 1.975 comportamenti verificati tramite riproduzione in 26 applicazioni. A partire da questi comportamenti, ha creato 4.063 attività.

Il benchmark comprende attività con diversi livelli di difficoltà. Alcune richiedono di ripristinare singole funzionalità, mentre altre mettono alla prova flussi di lavoro cumulativi in cui più comportamenti devono funzionare insieme. In questo modo la valutazione può misurare non solo se un agente è in grado di implementare una funzionalità isolata, ma anche se sa preservare le dipendenze necessarie per una sequenza di azioni più lunga.

Il benchmark viene valutato su nove agenti di programmazione all’avanguardia. I risultati mostrano una netta differenza tra la riparazione di singole funzionalità e la ricostruzione di un’intera applicazione. Nello scenario di ricostruzione dell’intera applicazione, GPT-6 Astra ha raggiunto un tasso di successo del 49,2% nei flussi di lavoro cumulativi, mentre Claude Opus 5 ha raggiunto il 28,8%.

Il successo cala man mano che i flussi di lavoro si fanno più complessi

ProgramDistill misura anche le prestazioni nella ricostruzione parziale di un’applicazione all’aumentare della profondità del ripristino. Alla profondità uno, GPT-6 Astra ha raggiunto un tasso di successo del 100%, ma il dato è sceso al 64,0% alla profondità otto. Claude Opus 5 è passato dal 96% alla profondità uno al 32% alla profondità otto.

Questi risultati indicano che gli agenti ottengono prestazioni migliori quando devono ripristinare un singolo comportamento, rispetto a quando devono ricostruire una sequenza di comportamenti dipendenti l’uno dall’altro. Un flusso di lavoro può richiedere a un agente di dedurre non solo che cosa fa una singola azione, ma anche come modifica lo stato necessario alle azioni successive.

Collegando ogni attività a un comportamento riprodotto tramite un’applicazione di riferimento funzionante, ProgramDistill offre un modo controllato per variare la difficoltà delle attività, mantenendo al contempo un processo di verifica eseguibile. Gli autori descrivono il benchmark come una base per valutare e diagnosticare gli agenti di programmazione, nonché per future forme di addestramento basate su un curriculum.

Fonte

Esplora

Altri articoli