Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。