Vai al contenuto
AI.info

Ricerca

EvoUndo: autoevoluzione degli ambienti di esecuzione degli agenti LLM vincolata alla recuperabilità

Gli agenti LLM modificano sempre più spesso, durante l’esecuzione, i propri prompt, strumenti, middleware, risorse e ambienti di esecuzione. Questa autoevoluzione può migliorarne le capacità, ma una m

EvoUndo: autoevoluzione degli ambienti di esecuzione degli agenti LLM vincolata alla recuperabilità
arXiv
2608.28363
Pubblicato
2026-08-28
Autori
Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah

Abstract degli autori

Gli agenti LLM modificano sempre più spesso, durante l’esecuzione, i propri prompt, strumenti, middleware, risorse e ambienti di esecuzione. Questa autoevoluzione può migliorarne le capacità, ma una modifica riuscita può lasciare effetti persistenti che non possono essere annullati in sicurezza in stati diversi da quello in cui è stata creata. Presentiamo EvoUndo, un framework per rappresentare, generare, diagnosticare e verificare in modo indipendente la recuperabilità delle automodifiche generate dai modelli in diversi stati controfattuali. Su 600 attività di autoevoluzione one-shot mai viste prima, individuiamo 197 modifiche che migliorano le capacità ma non superano la verifica della recuperabilità. Con la rappresentazione originaria del ripristino, le strategie di riparazione convenzionali non riescono a recuperare nessuno di questi 197 casi di fallimento. Un’analisi deterministica con oracolo ne recupera 48/197 con il linguaggio di ripristino originario L0, mentre il calcolo di ripristino esteso porta a 191/197 il numero di casi recuperati empiricamente dall’oracolo. Un intervento 2x2, con protocollo fisso, che incrocia ancoraggio ed espressività distingue quindi due limiti: quando il linguaggio originario è sufficiente, l’ancoraggio agli indirizzi esatti dello stato porta i recuperi riusciti da 0/48 a 38/48 (79,2%); l’estensione del linguaggio di ripristino, invece, consente il recupero di 142/143 (99,3%) casi di fallimento nello strato S1 definito dall’oracolo. Con il modello di base principale gpt-oss-120b, l’aggiunta di informazioni diagnostiche sugli indirizzi esatti al linguaggio più espressivo riduce i recuperi a 133/143 (93,0%); una replica con Qwen3.8-27B conferma gli effetti dell’ancoraggio e dell’espressività, ma non questa interazione negativa, indicando che quest’ultima dipende dal modello. Questi risultati indicano che un’autoevoluzione affidabile degli agenti richiede di progettare congiuntamente verifica, ancoraggio allo stato, semantica dei testimoni ed espressività del linguaggio di ripristino, anziché affidarsi soltanto a prompt iterativi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv