Ricerca
RULER: ricompense basate su rubriche consapevoli dell’istanza per la generazione di SVG
Generare codice Scalable Vector Graphics (SVG) a partire da istruzioni in linguaggio naturale è un compito aperto, privo di un ground truth visivo assoluto, che non offre quindi un segnale fedele né p

- arXiv
- 2609.25270
- Pubblicato
- 2026-09-21
- Autori
- Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng
Abstract degli autori
Generare codice Scalable Vector Graphics (SVG) a partire da istruzioni in linguaggio naturale è un compito aperto, privo di un ground truth visivo assoluto, che non offre quindi un segnale fedele né per la valutazione né per l’ottimizzazione delle policy. Le metriche scalari (CLIP, Aesthetic), calibrate su immagini naturali, si trasferiscono male ai contenuti vettoriali stilizzati e, se riutilizzate come ricompense per l’apprendimento per rinforzo (RL), portano a manipolare la ricompensa. Affrontiamo entrambi i limiti con una valutazione basata su rubriche. Per prima cosa, dimostriamo empiricamente che chiedere a un valutatore visivo-linguistico di applicare una rubrica multi-asse produce risultati molto più correlati ai giudizi umani rispetto alle metriche scalari, sia nel confronto tra campioni sia all’interno delle singole istruzioni. Sulla base di questa osservazione, introduciamo RULER (Instance-aware Rubric Rewards for Reinforcement Learning), che trasforma ogni istruzione in una rubrica consapevole dell’istanza composta da sei voci, relative ad aspetti semantici, visivi e stilistici; un modello VLM giudica i risultati generati e renderizzati voce per voce, e i livelli di soddisfacimento ponderati formano una ricompensa dettagliata, ottimizzata tramite Group Relative Policy Optimization. Poiché la rubrica deriva solo dal testo, RULER non richiede né ground truth SVG abbinati né etichette di preferenza umana. Su MMSVG-Illustration e MMSVG-Icon, RULER aumenta il punteggio della rubrica da 0,432/0,395 a 0,693/0,683, superando gli specialisti SVG dedicati e raggiungendo risultati pari a quelli del modello DeepSeek-V3, molto più grande; gli studi di ablazione individuano nella progettazione della rubrica il fattore determinante per l’RL nella generazione aperta di SVG. La pagina del progetto è disponibile all’indirizzo https://hangyuran.github.io/RULER/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv