Ricerca
Safin-1: sicurezza dall’interno attraverso l’evoluzione dello stato nativa della memoria
I compiti complessi che si sviluppano su lunghi periodi richiedono ai modelli di base di accumulare informazioni, mantenere stati interni e adattarsi nel corso di interazioni prolungate. La sicurezza

- arXiv
- 2609.00092
- Pubblicato
- 2026-08-31
- Autori
- Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu
Abstract degli autori
I compiti complessi che si sviluppano su lunghi periodi richiedono ai modelli di base di accumulare informazioni, mantenere stati interni e adattarsi nel corso di interazioni prolungate. La sicurezza dovrebbe essere una proprietà intrinseca del modello, anziché un vincolo comportamentale che dipende esclusivamente da misure di protezione esterne o da un allineamento successivo, come il fine-tuning supervisionato. Da qui nasce Safety from Within, un approccio in cui le capacità rilevanti per la sicurezza sono rappresentate e attivate attraverso i meccanismi di calcolo nativi del modello. Presentiamo Safin-1, una famiglia di modelli di base che realizza questo principio attraverso l’instradamento della memoria e l’evoluzione dello stato. Safin-1 si basa su Memory-Anchor Routing across Context History (MARCH), un’architettura di rete che mantiene stati di memoria strutturati e recupera selettivamente le informazioni storiche pertinenti mediante un instradamento condizionato dal contenuto. Consente l’adattamento, in fase di test, di stati persistenti delle capacità senza modificare ripetutamente la struttura portante del modello, permettendo una specializzazione controllata a partire da una base condivisa. Esaminiamo questa interfaccia in compiti di sicurezza a valle attraverso un Safety State, mostrando un adattamento efficace basato sullo stato e miglioramenti sostanziali della sicurezza. Più in generale, l’interfaccia basata sull’instradamento degli stati unifica la memoria contestuale e l’adattamento persistente delle capacità all’interno dei meccanismi di calcolo nativi del modello: la memoria non è più intesa come una registrazione passiva del contesto precedente, ma come una base attiva per mantenere ed evolvere il comportamento del modello. Le valutazioni delle capacità generali, della comprensione di contesti lunghi, del recupero delle informazioni e dell’efficienza forniscono ulteriori conferme della validità di Safin-1. Questi risultati indicano una strada verso una sicurezza che sia una capacità nativa dello stato e possa essere mantenuta in modo adattivo. Questo lavoro è soltanto una prima esplorazione architetturale di Safety from Within e servirà molto altro lavoro per realizzare questa visione più ampia.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv