Vai al contenuto
AI.info

Ricerca

Rapporto tecnico su LongCat-DeepResearch

Presentiamo LongCat-DeepResearch, un sistema di ricerca approfondita che combina una versione migliorata del modello LongCat con un flusso di lavoro multiagente per produrre rapporti completi e fondat

Rapporto tecnico su LongCat-DeepResearch
arXiv
2609.36071
Pubblicato
2026-09-28
Autori
Meituan LongCat Team, He Zhu, Yue Xu, Wanli Wu, Haolin Ren, Yuxin Bian, Jiarui Zhao, Rongzhi Zhang, Quanchi Weng, Jinghao Cui, Yu Fan, Yuhan Liu, Yunhu Ye, Jiyuan Ren, Fengcheng Yuan, Zhao Yang, Jiacheng Zhang, Yuchuan Dai, Ruixuan Xiao, Haozhe Sun, Xiangyuan Liu, Cheng Sun, Yao Du, Yiming Hao, Hongbo Guo, Shuo He, Lei Wang, Xunliang Cai, Yan Chen, Fan Yang, Lingchuan Liu

Abstract degli autori

Presentiamo LongCat-DeepResearch, un sistema di ricerca approfondita che combina una versione migliorata del modello LongCat con un flusso di lavoro multiagente per produrre rapporti completi e fondati su prove. Il flusso di lavoro separa la pianificazione generale dall’indagine dettagliata e coordina le revisioni a livello di sezione. Dapprima, più agenti incaricati della pianificazione esplorano fonti esterne e perfezionano un piano di ricerca attuabile, chiamato ResearchSpec. Gli agenti di ricerca indagano poi sugli argomenti delle sezioni loro assegnate e ne redigono le bozze in parallelo, raccogliendo ulteriori prove in contesti separati man mano che sviluppano le proprie analisi. Una volta assemblate le sezioni, una revisione complessiva orienta interventi locali mirati, riducendo il ricorso a ripetute riscritture dell’intero rapporto. Questo flusso di lavoro permette anche di costruire attività e traiettorie di ricerca per l’addestramento intermedio e il post-addestramento dei modelli generalisti di LongCat. LongCat-DeepResearch ottiene 55,25 su DeepResearchBench, 51,35 su DeepResearchBench II e 79,83 su ResearchRubrics. Su un benchmark interno ottiene 76,04, classificandosi secondo tra quattro sistemi confrontati. Le analisi condotte sul set di sviluppo mostrano i benefici della combinazione di diverse prospettive di pianificazione, mentre un ulteriore perfezionamento della pianificazione produce effetti contrastanti. Un’ulteriore fase di editing migliora la preferenza automatica media relativa alla leggibilità su due benchmark, con andamenti diversi per ciascuno.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv