Ricerca
OneSearch-VL: un agente unificato per la ricerca approfondita multimodale su immagini e video
La ricerca approfondita su una singola immagine, su più immagini e su video richiede operazioni visive diverse, ma segue un flusso di lavoro comune: ancoraggio visivo, reperimento di informazioni este
- arXiv
- 2610.12419
- Pubblicato
- 2026-10-08
- Autori
- Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu
Abstract degli autori
La ricerca approfondita su una singola immagine, su più immagini e su video richiede operazioni visive diverse, ma segue un flusso di lavoro comune: ancoraggio visivo, reperimento di informazioni esterne e composizione dei fatti. Una sfida fondamentale è preservare le dipendenze che collegano riferimenti visivi localizzati, relazioni tra entità, fatti corroborati dalle fonti e operazioni che producono la risposta. Presentiamo OneSearch-VL, un agente unificato incentrato sul Visually Grounded Evidence Graph (VGEG), che codifica queste dipendenze come riferimento comune a livello di attività per la costruzione dei dati, la supervisione del processo e la valutazione delle singole operazioni. Il nostro sistema di costruzione dei dati basato su VGEG crea e verifica domande su più immagini e su video e filtra le traiettorie degli esperti. Con questi dati, prepariamo OneSearch-VL-SFT-110K e OneSearch-VL-RL-10K, rispettivamente per SFT e RL. Dalle annotazioni VGEG ricaviamo inoltre la ricompensa Evidence-aware Visual-Grounded Rubric reward (EVGR), per supervisionare la tracciabilità delle evidenze e l’ancoraggio visivo durante RL. Per una valutazione dettagliata, realizziamo OneSearch-MI-Bench e OneSearch-Video-Bench, organizzando le domande in base alle operazioni di ricerca codificate nei rispettivi VGEG. Gli esperimenti mostrano che OneSearch-VL-8B supera Qwen3-VL-8B con accesso agli strumenti di 20,2 e 17,6 punti percentuali nei due nuovi benchmark, rispettivamente, ottenendo anche miglioramenti sostanziali in 7 benchmark sulle immagini e in VideoDR. Repository del progetto: https://github.com/appletea233/OneSearch-VL
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv