Vai al contenuto
AI.info

Ricerca

Quando le interfacce parlano: un’infrastruttura per interfacce utente generative consapevoli dei dati per l’interazione attiva

Oggi la maggior parte delle interazioni tra persone e agenti avviene ancora tramite testo. Per i compiti complessi, il linguaggio naturale può comportare un sovraccarico cognitivo, ambiguità, caos inf

arXiv
2610.11123
Pubblicato
2026-10-08
Autori
Xiaolong Li, Xiaohan Xu, Jinyang Li, Xinnuo Xu, Ge Qu, Nan Huo, Jack Williams, Reynold Cheng

Abstract degli autori

Oggi la maggior parte delle interazioni tra persone e agenti avviene ancora tramite testo. Per i compiti complessi, il linguaggio naturale può comportare un sovraccarico cognitivo, ambiguità, caos informativo e lentezza nell’inserimento dei dati; le interfacce utente generative temporanee possono invece presentare informazioni strutturate e guidare gli utenti verso il completamento del compito. Proponiamo GenUI-Harness, un’infrastruttura multiagente che abbina un Tool Agent, incaricato di reperire informazioni ed eseguire compiti, a un GUI Coder Agent, che individua le ambiguità e genera codice front-end per interfacce strutturate. Addestrare l’agente che scrive il codice con l’apprendimento per rinforzo è difficile: le ricompense verificabili per la generazione di interfacce interattive richiedono un’esecuzione costosa, mentre le ricompense basate su LLM-as-a-Judge sono vulnerabili al reward hacking. Affrontiamo la prima difficoltà con Dynamic UX, un pacchetto leggero per l’interazione dinamica e la raccolta delle ricompense in un unico ambiente isolato, e la seconda con Reward Auditor, un meccanismo di metaricompensa che monitora le distribuzioni delle ricompense e condensa gli schemi diagnostici in una griglia di valutazione condivisa e in una specifica per l’attribuzione dei punteggi. Presentiamo UI-TAU Bench, un benchmark per l’interazione attiva tra persone e agenti attraverso codice generato per interfacce utente. Si fonda su 10 database relativi a settori del mondo reale, costruiti a partire da fonti di dati pubbliche, e sulle impostazioni di utilizzo degli strumenti di Tau-Bench; comprende le suddivisioni Lite (300 compiti) e Full (1.000 compiti). Su Lite, GenUI-Harness ottiene un incremento medio di Pass@3 di 4,48 punti percentuali rispetto a smolagents. L’addestramento con GenUI-Harness porta il Pass@3 di un modello di base da 4B dal 9,33% al 58,00%, superando modelli di frontiera più grandi come Claude Opus 5 (46,67%). GenUI-Harness si dimostra inoltre robusto sia con richieste ambigue sia con richieste non ambigue. In un sondaggio tra revisori che confronta i canali di comunicazione, le interfacce utente generate riducono il numero medio di scambi nel dialogo da 3,4 a 1,2. Questi risultati mostrano che le interfacce generative consapevoli dei dati possono favorire il completamento efficace dei compiti e ridurre gli scambi nel dialogo nei flussi di lavoro valutati che si basano su database.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv