Ricerca
RAG-Safety-Bench: valutazione affidabile della sicurezza dei modelli linguistici aumentati con il recupero
Consentire ai modelli linguistici di grandi dimensioni (LLM) di recuperare informazioni da un insieme di documenti affidabili può aumentarne l’affidabilità e ridurre le allucinazioni. Tuttavia, studi

- arXiv
- 2609.11758
- Pubblicato
- 2026-09-10
- Autori
- Adithiyan Rajan Indira Saravanan, Kathleen C. Fraser
Abstract degli autori
Consentire ai modelli linguistici di grandi dimensioni (LLM) di recuperare informazioni da un insieme di documenti affidabili può aumentarne l’affidabilità e ridurre le allucinazioni. Tuttavia, studi recenti hanno dimostrato che la generazione aumentata con il recupero (RAG) può avere effetti collaterali indesiderati sulla sicurezza complessiva delle risposte generate quando viene richiesto contenuto dannoso o pericoloso. È necessario comprendere meglio i meccanismi che portano a questo risultato, dato che un numero crescente di utenti finali ricorre alla RAG per integrare documenti aziendali e basi di conoscenza nei sistemi basati su LLM. Presentiamo RAG-Safety-Bench, un benchmark per misurare l’impatto della RAG sulla sicurezza dei modelli LLM. Eliminando l’effetto confondente della qualità del retriever e separando nettamente il problema in quattro condizioni — senza RAG, RAG con un documento oracolo che contiene la risposta alla richiesta dannosa, RAG con documenti attinenti alla richiesta dannosa ma privi della risposta specifica e RAG con documenti casuali e sicuri — il benchmark isola l’impatto dei diversi fattori sul peggioramento della sicurezza osservato. Presentiamo i risultati ottenuti con cinque LLM open source, che mostrano una relazione inversa tra le capacità innocue e quelle non sicure, evidenze solide del fatto che le protezioni di sicurezza di base non garantiscono la sicurezza nelle fasi successive nel caso della RAG e, per alcuni modelli, confermano risultati precedenti secondo cui anche documenti innocui possono portare a generazioni non sicure nei sistemi dotati di recupero.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv