Ricerca
Apprendimento per rinforzo con testimone minimo
«Quali sono le condizioni irriducibili sufficienti a produrre un risultato?» è una delle domande più ricorrenti nel calcolo e nella scienza. Le sue risposte, i testimoni sufficienti minimi, sono ciò c

- arXiv
- 2610.07226
- Pubblicato
- 2026-10-05
- Autori
- T. Y. Tsui, Zihao Ye, Pengxiang Cai, Yanchao Li, Yuqiang Li, Zhehong Ai
Abstract degli autori
«Quali sono le condizioni irriducibili sufficienti a produrre un risultato?» è una delle domande più ricorrenti nel calcolo e nella scienza. Le sue risposte, i testimoni sufficienti minimi, sono ciò che intendiamo per spiegazioni, meccanismi e ragioni. Di solito questi problemi richiedono più testimoni minimi, ma i metodi standard di apprendimento per rinforzo possono rivelare una sola soluzione oppure soluzioni ridondanti. Formalizziamo il problema come identificazione dei testimoni minimi e introduciamo Minimal-Witness Reinforcement Learning (MWRL). MWRL prende l’unione degli insiemi certificati dalle proposte riuscite campionate dalla policy e attribuisce a ciascuna proposta un credito pari alla copertura che l’unione del gruppo perderebbe senza di essa. Questa attribuzione del credito, derivata direttamente dalla definizione del problema, concilia l’esigenza di minimalità con quella di recuperare soluzioni alternative a partire da un unico bit fornito da un verificatore black-box. Su questo principio basiamo un pianificatore che usa la value iteration e recupera l’intera famiglia dei testimoni, e un metodo basato sul gradiente della policy che può scalare fino ai grandi modelli linguistici. In diverse configurazioni sperimentali, MWRL recupera la maggior parte dei testimoni minimi, mentre altri metodi restituiscono sovrainsiemi ridondanti o un solo testimone. Rendendo possibile apprendere le famiglie di testimoni dal feedback del verificatore, MWRL estende l’ambito dell’apprendimento per rinforzo oltre l’ottimizzazione di una singola soluzione. Il nostro codice è disponibile all’indirizzo https://github.com/TSUITUENYUE/MWRL.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv