Vai al contenuto
AI.info

Ricerca

Ragionamento strutturato basato sulla selezione: verso agenti di ricerca multimodale efficienti

Gli agenti multimodali generano comunemente ragionamenti in forma libera prima di ogni azione. Nei modelli piccoli, la capacità limitata può portare a ragionamenti lunghi che offrono poche indicazioni

Ragionamento strutturato basato sulla selezione: verso agenti di ricerca multimodale efficienti
arXiv
2610.01892
Pubblicato
2026-10-01
Autori
Feiyu Gavin Zhu, Xiaoyu Zhu, Jiqi Yang, Rui Yang, Arnab Kumar Mondal, Yancheng Wang, Xinke Deng, Jean Oh, Reid Simmons, Joerg Liebelt, Xiang Kong, Zhongyu Jiang

Abstract degli autori

Gli agenti multimodali generano comunemente ragionamenti in forma libera prima di ogni azione. Nei modelli piccoli, la capacità limitata può portare a ragionamenti lunghi che offrono poche indicazioni utili per generare le azioni, pur comportando un notevole costo di inferenza. Per affrontare questa difficoltà, presentiamo Selection-based Structured Reasoning (SSR), un framework che riformula il ragionamento come selezione anziché come generazione aperta. SSR rappresenta i ragionamenti ricorrenti ad alto livello mediante candidati predefiniti, riutilizzabili e formulati in linguaggio naturale. A ogni turno, il modello seleziona tra questi candidati in base alle loro verosimiglianze dato il contesto corrente, senza richiedere una testa ausiliaria per il compito. L’uso di tracce di ragionamento predefinite consente di calcolare i punteggi in parallelo: il prefilling con teacher forcing calcola contemporaneamente le verosimiglianze dei token all’interno dei singoli candidati e tra candidati diversi, usando una cache KV del contesto condivisa. Valutiamo SSR su sette benchmark di ricerca multimodale con modelli 2B e 4B. Con diverse funzioni obiettivo di apprendimento per rinforzo e con il fine-tuning supervisionato, SSR offre notevoli guadagni di efficienza senza sacrificare le prestazioni nel compito. SSR raggiunge un tasso medio di successo competitivo con quello dei principali agenti di ricerca della stessa scala, riducendo al contempo la latenza del ragionamento per turno di oltre il 90% e la latenza complessiva dell’inferenza del modello per domanda del 28-54%. Pagina del progetto: https://zfy0314.github.io/ssr-webpage/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv