Ricerca
VeriHarness: ampliare la verifica agentica per compiti a lungo orizzonte
Man mano che gli agenti basati su LLM affrontano compiti a lungo orizzonte sempre più complessi, verificare i loro risultati diventa sempre più difficile. Studiamo come rafforzare la capacità di verif

- arXiv
- 2610.00972
- Pubblicato
- 2026-10-01
- Autori
- Caiqi Zhang, Rujun Han, Zifeng Wang, Zoey CuiZhu, Nigel Collier, Tomas Pfister, Chen-Yu Lee
Abstract degli autori
Man mano che gli agenti basati su LLM affrontano compiti a lungo orizzonte sempre più complessi, verificare i loro risultati diventa sempre più difficile. Studiamo come rafforzare la capacità di verifica mantenendo invariato il modello di base, senza accesso alle risposte di riferimento o ai criteri di valutazione in fase di test. Il campionamento ripetuto produce più rollout che possono contenere affermazioni corrette complementari, ma serve un meccanismo di verifica affidabile per stabilire di quali fidarsi. Per prima cosa osserviamo che le divergenze spesso portano alla luce alternative corrette, mentre il consenso può nascondere errori. Queste osservazioni sono alla base di VeriHarness, che trasforma l’LLM su cui si basa un generatore in un verificatore agentico, dotandolo di uno spazio di lavoro, strumenti per raccogliere evidenze e competenze di verifica riutilizzabili. Un modulo che risolve le divergenze controlla le affermazioni in conflitto alla luce delle evidenze disponibili nell’ambiente, mentre un modulo che mette alla prova il consenso verifica le affermazioni condivise e cerca requisiti omessi. I risultati di queste verifiche guidano la selezione e la revisione dell’artefatto finale. Su cinque benchmark relativi a spazi di lavoro per compiti a lungo orizzonte e con due modelli all’avanguardia, VeriHarness ottiene i punteggi di selezione più alti tra i metodi di riferimento valutati. La revisione basata su evidenze migliora ulteriormente le prestazioni medie, portando il vantaggio rispetto a un singolo rollout a 6,2 punti con Gemini 3.5 Flash e a 6,4 punti con Claude Opus 4.8. Mostriamo inoltre che le competenze di verifica possono migliorare autonomamente grazie al feedback sui fallimenti, a dimostrazione del fatto che VeriHarness offre un approccio nuovo e fondamentale per ampliare la verifica agentica a lungo orizzonte. Rendiamo disponibile l’intera raccolta di circa 26.000 rollout, relativi a tutti e cinque i benchmark e a entrambi i modelli e prodotti con una spesa superiore a 100.000 dollari, per sostenere la ricerca futura sulla verifica agentica.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv