Ricerca
Ignoranza o incompetenza? Costruire compiti verificabili vincolati all’accesso alle conoscenze per agenti basati su LLM
I compiti affidati agli agenti in ambito professionale dipendono spesso da convenzioni assenti dai corpora pubblici, ma i benchmark raramente controllano se un agente abbia accesso a tali convenzioni.

- arXiv
- 2608.30322
- Pubblicato
- 2026-08-31
- Autori
- Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu
Abstract degli autori
I compiti affidati agli agenti in ambito professionale dipendono spesso da convenzioni assenti dai corpora pubblici, ma i benchmark raramente controllano se un agente abbia accesso a tali convenzioni. Presentiamo un protocollo per costruire compiti vincolati all’accesso alle conoscenze, che separa le istruzioni del compito da un artefatto compatto contenente convenzioni private, tabelle di riferimento e operatori di utilità. La provenienza documentata durante la costruzione, le istruzioni del compito identiche byte per byte nelle condizioni con artefatto fornito e con artefatto non fornito, le verifiche delle fughe di informazioni e i testimoni eseguibili rendono esplicita e verificabile la dipendenza dall’artefatto. Su quindici compiti di calibrazione, una configurazione di agente di frontiera raggiunge un tasso di superamento del 68,0% con l’artefatto e dello 0% senza; per uno dei compiti, anche un artefatto plausibile ma errato produce un tasso dello 0% in cinque prove. Risolutori deterministici e corpora di regole forniscono risultati corretti esatti per i compiti strutturati, mentre griglie di valutazione con criteri esplicitamente denominati permettono di valutare risultati che non possono essere verificati da un unico oracolo eseguibile. Un filtro di calibrazione relativo alla configurazione conserva sette compiti che soddisfano il nostro criterio empirico di dipendenza dalla conoscenza, valutato su cinque prove. Questi esperimenti convalidano il comportamento del protocollo di costruzione; non dimostrano che i compiti conservati migliorino il post-training. Rendiamo pubblicamente disponibili parte della raccolta di compiti e gli strumenti di supporto all’indirizzo https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv