Vai al contenuto
AI.info

Ricerca

Uno sguardo più da vicino alla BBO agentica: valutare gli agenti LLM nell’ottimizzazione a scatola nera

L’ottimizzazione a scatola nera (BBO) si presenta in molti problemi scientifici e ingegneristici in cui valutare la funzione obiettivo è costoso e il numero di valutazioni è limitato. I recenti agenti

Uno sguardo più da vicino alla BBO agentica: valutare gli agenti LLM nell’ottimizzazione a scatola nera
arXiv
2610.12183
Pubblicato
2026-10-08
Autori
Ming Chen, Rong-Xi Tan, Ke Xue, Yu-Jie Zhou, Taiye Lu, Zhi-Xuan Gao, Peng Xie, Zijun Shen, Chen Lu, Haopu Shang, Chao Qian

Abstract degli autori

L’ottimizzazione a scatola nera (BBO) si presenta in molti problemi scientifici e ingegneristici in cui valutare la funzione obiettivo è costoso e il numero di valutazioni è limitato. I recenti agenti basati su modelli linguistici di grandi dimensioni (LLM) offrono un nuovo approccio alla BBO, combinando la semantica del compito, il calcolo, gli strumenti di ottimizzazione e decisioni guidate dal feedback. Grazie all’integrazione con strumenti matematicamente rigorosi, mostrano un grande potenziale. Tuttavia, gli studi esistenti sulla BBO agentica adottano ambiti applicativi e configurazioni di sistema diversi: è quindi difficile confrontarne i risultati e isolare gli effetti delle singole scelte progettuali. Presentiamo perciò AgenticBBO-Bench, un benchmark che comprende funzioni sintetiche, ottimizzazione degli iperparametri, messa a punto di database, progettazione di chip e progettazione molecolare, valutati secondo un protocollo uniforme con un budget limitato. Nei nostri esperimenti, la BBO agentica ottiene punteggi medi per famiglia superiori a quelli dei metodi diretti basati su LLM in tutti e cinque gli ambiti e supera i migliori ottimizzatori numerici in quattro. Esaminiamo inoltre tre fattori che influenzano le prestazioni degli agenti: gli strumenti di ottimizzazione, le informazioni sul compito e le conoscenze pregresse, e il ruolo dell’LLM durante la ricerca. I risultati mostrano che aggiungere strumenti numerici non migliora le prestazioni in modo sistematico, che la semantica del compito è ampiamente utile mentre le conoscenze a priori più specifiche sono meno affidabili, e che gli ottimizzatori numerici possono sfruttare efficacemente i miglioramenti derivanti dalle traiettorie di ricerca tracciate dall’agente. Infine, introduciamo in AgenticBBO-Bench una sfida di frontiera composta da cinque compiti e valutiamo sette LLM nell’ambiente di esecuzione dell’agente Codex: tra i modelli valutati, GPT-6 Astra e DeepSeek-V4.1-Flash si collocano sulla frontiera di Pareto per prestazioni e costi. Il nostro codice è disponibile all’indirizzo https://github.com/lamda-bbo/agentic-bbo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv