Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
Visual-Seeker:通过主动视觉推理实现视觉原生多模态智能搜索
机构 * School of Artificial Intelligence UCAS(中国科学院大学人工智能学院) ; Institute of Automation CAS(中国科学院自动化研究所) ; Ant Digital Technologies Ant Group(蚂蚁数字科技蚂蚁集团) ; RUC(中国人民大学) ; BIT(北京理工大学)
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI
AI总结 提出Visual-Seeker,一种通过主动视觉推理进行视觉原生多模态深度搜索的智能体,在五个基准上达到最先进性能,甚至超越专有模型。