Ricerca
Feyospace-v1: come i Cyber Mercury Seven hanno addestrato modelli di cybersicurezza all’avanguardia
L’addestramento di agenti di cybersicurezza capaci viene spesso considerato soprattutto un problema di dimensioni del modello. Il post-addestramento di modelli con pesi aperti, però, è limitato più di

- arXiv
- 2609.08418
- Pubblicato
- 2026-09-08
- Autori
- Zongjie Li, Alan Z. W, John Nicolas J, Walter H. F, Scott Donald L, Gordon Y. P, Deke X
Abstract degli autori
L’addestramento di agenti di cybersicurezza capaci viene spesso considerato soprattutto un problema di dimensioni del modello. Il post-addestramento di modelli con pesi aperti, però, è limitato più direttamente dal costo degli ambienti eseguibili, dalla necessità di una supervisione affidabile su più turni e dall’accesso a modelli insegnanti potenti. Presentiamo un framework incentrato sui dati che affronta questi ostacoli attraverso cinque sistemi complementari: Choulea analizza le firme del ragionamento nascosto, SkyReal riduce il costo del campionamento dai modelli insegnanti, Hongzwang aggira le restrizioni delle API sull’esecuzione dei modelli insegnanti, PSBreakup ripristina le capacità indebolite dalla fusione dei modelli e Kreator trasforma gli interventi degli esperti in ragionamenti utilizzabili per l’addestramento. Il nostro motore di generazione dei dati crea ambienti ripristinabili per la programmazione, le vulnerabilità, le CTF, la cronologia del kernel, gli exploit completi e il firmware, oltre ad ambienti basati su dispositivi. Le traiettorie candidate vengono conservate solo dopo la verifica dell’esecuzione e il controllo delle prove, producendo 164.269 traiettorie per il fine-tuning supervisionato su contesti lunghi. I tre checkpoint migliorano rispetto ai rispettivi modelli di partenza in media del 23,76% sull’intera suite CyberGym e del 10,49% sull’insieme delle suite CTF aggregate. Al 1° settembre 2026, Feyospace-s1 raggiunge un tasso di successo verificato del 63,24% e si colloca al 10° posto nella classifica ufficiale di CyberGym, mentre tutti e tre i checkpoint sono al 1° posto tra i modelli con un numero di parametri comparabile. Per quanto ne sappiamo, questa è la prima dimostrazione completa che un team indipendente di sette persone può addestrare modelli con pesi aperti dotati di capacità agentiche di cybersicurezza all’avanguardia.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv