Vai al contenuto
AI.info

Ricerca

SafeAtlas-VL: oltre la valutazione binaria della sicurezza multimodale con dati su larga scala e modelli di controllo

La moderazione della sicurezza multimodale richiede di distinguere i rischi derivanti dai contenuti visivi, dalle intenzioni dell’utente e dal comportamento dell’assistente. Le misure di protezione es

SafeAtlas-VL: oltre la valutazione binaria della sicurezza multimodale con dati su larga scala e modelli di controllo
arXiv
2608.29098
Pubblicato
2026-08-29
Autori
Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu Zhang, Chunyi Li, Yue Shi, Kaiwei Zhang, Zicheng Zhang, Yuan Tian, Qi Jia, Yan Teng, Wei Sun, Ning Liu, Guangtao Zhai

Abstract degli autori

La moderazione della sicurezza multimodale richiede di distinguere i rischi derivanti dai contenuti visivi, dalle intenzioni dell’utente e dal comportamento dell’assistente. Le misure di protezione esistenti, tuttavia, sono generalmente addestrate per un unico oggetto di valutazione e riducono la valutazione della sicurezza a una decisione binaria. Di conseguenza, diventa difficile confrontare i rischi nel corso di un’interazione multimodale e i casi ambigui risultano meno evidenti. Presentiamo SafeAtlas-VL, un dataset di 1,5 milioni di esempi di addestramento che colloca le valutazioni relative alle immagini, alle richieste e alle risposte su una scala ordinale a cinque livelli. Raccogliamo un’ampia gamma di dati pertinenti alla sicurezza, provenienti sia dal mondo reale sia da fonti sintetiche, e applichiamo una procedura di annotazione che tiene conto dei disaccordi. Il dataset risultante comprende 15 categorie di danno e 55 sottocategorie dettagliate, coprendo un’ampia gamma di scenari di sicurezza multimodale. Realizziamo inoltre SafeAtlas-Bench, un insieme separato di 5.000 esempi per valutare le previsioni su cinque livelli e i punteggi di rischio continui. Su questo dataset addestriamo la serie di modelli SafeAtlas Guard mediante fine-tuning condizionato all’oggetto della valutazione, per rilevare i rischi nella sicurezza multimodale. I nostri modelli non solo classificano i livelli di sicurezza in cinque classi, ma li associano anche a punteggi continui tramite una testa ordinale cumulativa soft. I risultati sperimentali mostrano che i modelli di controllo addestrati sul nostro dataset hanno una forte capacità di generalizzazione: anche senza utilizzare gli insiemi di addestramento di altri benchmark, ottengono prestazioni competitive sui rispettivi insiemi di test. In particolare, il nostro modello 8B ottiene le migliori prestazioni complessive, superando il precedente stato dell’arte di circa il 4% nel punteggio F1. Rendiamo disponibili codice, dati e modelli per sostenere ulteriori ricerche. Avvertenza: questo articolo contiene dati di esempio che potrebbero risultare offensivi, dannosi, espliciti o disturbanti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv