Vai al contenuto
AI.info

Ricerca

Pensare fuori dagli schemi: i modelli linguistici possono affidarsi selettivamente alle indicazioni esterne?

I sistemi di orchestrazione degli agenti spesso migliorano i modelli linguistici grazie a flussi di lavoro progettati da esseri umani. Ma, man mano che i modelli diventano più capaci, indicazioni inaf

Pensare fuori dagli schemi: i modelli linguistici possono affidarsi selettivamente alle indicazioni esterne?
arXiv
2609.39578
Pubblicato
2026-09-30
Autori
Minghan Wang, Boyuan Wang, Jinhang Zuo, Yuxin Tao, Fang kong

Abstract degli autori

I sistemi di orchestrazione degli agenti spesso migliorano i modelli linguistici grazie a flussi di lavoro progettati da esseri umani. Ma, man mano che i modelli diventano più capaci, indicazioni inaffidabili possono limitarne sempre più l’esecuzione. Chiamiamo «pensare fuori dagli schemi» la capacità di trarre beneficio dalle indicazioni utili disattendendo quelle inaffidabili. Presentiamo Box$^2$-Bench, che mantiene invariati il modello e il compito e varia l’affidabilità dei flussi di lavoro, per isolare il modo in cui i modelli regolano il proprio affidamento sulle indicazioni. Su Box$^2$-Bench, i modelli di frontiera spesso traggono beneficio da indicazioni affidabili, ma restano vulnerabili quando queste sono fuorvianti o diventano inaffidabili. Per verificare se questa capacità possa essere appresa, addestriamo due modelli con pesi aperti usando flussi di lavoro inadeguati e riservando quelli validi alla valutazione. Esploriamo due strategie di addestramento complementari: il fine-tuning supervisionato controfattuale migliora la robustezza, mentre l’apprendimento per rinforzo basato sui risultati può spostare l’equilibrio verso un maggiore utilizzo dei flussi di lavoro utili. Rileviamo inoltre che questo comportamento si estende oltre i flussi di lavoro ad altre forme di informazione esterna, migliorando la correzione tra pari e la robustezza rispetto a una memoria corrotta. Nel complesso, i nostri risultati individuano nell’affidamento selettivo a informazioni esterne fallibili una dimensione dell’affidabilità degli agenti che le sole prestazioni nei compiti non colgono.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv