Ricerca
Assegnazione del credito dalla griglia di valutazione al codice per l’apprendimento per rinforzo
La generazione di applicazioni web interattive richiede ai modelli di creare applicazioni utilizzabili in HTML, CSS e JavaScript a partire da richieste in linguaggio naturale. A differenza della gener

- arXiv
- 2608.27906
- Pubblicato
- 2026-08-28
- Autori
- Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong Wang, Linjian Mo, Chenyi Zhuang
Abstract degli autori
La generazione di applicazioni web interattive richiede ai modelli di creare applicazioni utilizzabili in HTML, CSS e JavaScript a partire da richieste in linguaggio naturale. A differenza della generazione di codice convenzionale, la qualità di un’applicazione dipende da molteplici requisiti funzionali visibili all’utente, spesso legati a porzioni specifiche di codice, come i gestori di eventi, gli aggiornamenti dello stato, i frammenti del DOM o i selettori CSS. Il GRPO standard riduce questi risultati strutturati a un’unica ricompensa per l’intera sequenza e applica il vantaggio risultante in modo uniforme a tutti i token, indebolendo l’attribuzione del merito. Proponiamo \textbf{Rubric-to-Code Credit Assignment} (RCCA), un framework di apprendimento per rinforzo che trasforma il feedback funzionale relativo ai singoli criteri di valutazione in segnali di ottimizzazione localizzati nel codice generato. RCCA costruisce le attività di addestramento attorno a griglie esplicite di criteri funzionali, usa una ricompensa gerarchica per distinguere gli errori di formato, nel codice sorgente, in esecuzione e di funzionalità, e allinea le attribuzioni testuali prodotte dal valutatore alle porzioni di codice responsabili e ai token generati. Il modello risultante, \textbf{Ling-RCCA-Flash}, ottiene 41,25 punti su MiniAppBench, migliorando il punteggio di Ling-3.0-Flash di 32,20 punti e superando di poco Claude Opus 4.5. Raggiunge inoltre 76,19 punti su ArtifactsBench, migliorando il punteggio del modello SFT di 4,48 punti e stabilendo un nuovo punteggio massimo secondo la configurazione della classifica ufficiale di ArtifactsBench: supera infatti il punteggio di GPT-5 di 3,64 punti. Questo suggerisce che i miglioramenti a livello di implementazione siano trasferibili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv