2601.22060
2026-03-25
cs.CV
cs.AI
89%
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力
Wenxuan Huang, Yu Zeng, Qiuchen Wang, Zhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin Chen, Zehui Chen, Xu Tang, Yao Hu, Shaohui Lin, Philip Torr, Feng Zhao, Wanli Ouyang
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI
AI总结
本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。