Vai al contenuto
AI.info

Ricerca

EvoGenUI-Bench: valutare gli LLM come assistenti per la generazione di interfacce utente su più turni

I modelli linguistici di grandi dimensioni possono generare interfacce web interattive, ma per generare interfacce utente in modo affidabile occorre mantenere un artefatto eseguibile mentre le richies

EvoGenUI-Bench: valutare gli LLM come assistenti per la generazione di interfacce utente su più turni
arXiv
2608.29387
Pubblicato
2026-08-29
Autori
Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen

Abstract degli autori

I modelli linguistici di grandi dimensioni possono generare interfacce web interattive, ma per generare interfacce utente in modo affidabile occorre mantenere un artefatto eseguibile mentre le richieste degli utenti cambiano. Presentiamo EvoGenUI-Bench, un benchmark per la manutenzione delle interfacce su più turni che comprende 150 compiti di cinque turni, per un totale di 750 turni, in tre scenari: presentazione delle informazioni, interazione eseguibile e stato esterno fondato sull’uso di strumenti. Eseguiamo gli artefatti generati in un browser e li valutiamo usando schermate, evidenze tratte dal codice sorgente e dal DOM, tracce degli attori e log di esecuzione. Oltre al successo a livello di singolo turno e di intero episodio, misuriamo la capacità di conservare i risultati tra un turno e l’altro con Adjacent Pass Retention. Tra otto modelli, anche il migliore raggiunge un Turn Pass del 74,9%, ma completa solo il 37,3% degli episodi di cinque turni; nei compiti basati sugli strumenti, l’APR scende ulteriormente al 52,4%. L’analisi diagnostica mostra che i problemi nella presentazione riguardano soprattutto l’architettura delle informazioni, quelli nell’interazione la propagazione dello stato derivato e l’associazione delle affordance, mentre quelli nei compiti basati sugli strumenti coinvolgono anche l’ancoraggio allo stato esterno e la scomposizione dei requisiti. Questi risultati spostano la valutazione della generazione di interfacce utente dal giudizio su risultati isolati alla verifica che il comportamento dell’interfaccia, lo stato derivato, lo stato esterno e le affermazioni dell’assistente restino sincronizzati mentre l’artefatto evolve.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv