Ricerca
CoEM: potenziare il ragionamento su contesti lunghi con Commit-on-Evidence Memory
Il ragionamento su contesti lunghi è essenziale per compiti complessi e con orizzonti lunghi, ma le prestazioni dei modelli linguistici di grandi dimensioni (LLM) peggiorano all’aumentare della lunghe

- arXiv
- 2609.36935
- Pubblicato
- 2026-09-29
- Autori
- Jingguang Li, Yebo Wu, Zuyi Guo, Kailang Ma, Xianjie Dai, Han Zheng, Benwang Chen, Li Li, Can Rong, Heye Huang
Abstract degli autori
Il ragionamento su contesti lunghi è essenziale per compiti complessi e con orizzonti lunghi, ma le prestazioni dei modelli linguistici di grandi dimensioni (LLM) peggiorano all’aumentare della lunghezza del contesto. Gli approcci recenti affrontano il problema elaborando l’input un blocco alla volta e mantenendo nel contesto del modello una memoria testuale di dimensioni limitate. Tuttavia, comprimere le informazioni troppo presto può far perdere dettagli cruciali per il ragionamento successivo. In questo articolo presentiamo Commit-on-Evidence Memory (CoEM), che impara quando trasformare le evidenze tratte dalle fonti in fatti compatti da memorizzare. In particolare, con un budget fisso per la memoria nel contesto, CoEM conserva alla lettera estratti delle fonti potenzialmente utili in un insieme in sospeso, così che il contesto successivo possa chiarirne la rilevanza prima di una compressione irreversibile. Quando arriva nuovo contesto, una politica appresa riesamina ogni estratto in sospeso e decide se inserirlo nella memoria definitiva, conservarlo per un’ulteriore valutazione o scartarlo. Un verificatore con parametri congelati garantisce che i fatti proposti siano accettati solo se supportati dagli estratti conservati e dal contesto corrente. Per orientare ulteriormente la gestione della memoria, addestriamo questa politica mediante apprendimento per rinforzo, combinando ricompense granulari legate alle evidenze a livello di singolo passaggio con ricompense basate sulla risposta finale. Numerosi esperimenti dimostrano che CoEM migliora costantemente il ragionamento su contesti lunghi. Su un input di contesto lungo composto da 6.400 documenti, CoEM supera la migliore baseline basata sulla memoria di 10,4-11,4 punti F1 con Qwen3.5-9B. Repository del codice: https://github.com/benmagnifico/CoEM.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv