Training Multi-Image Vision Agents via End2End Reinforcement Learning
通过端到端强化学习训练多图像视觉代理
机构 * MeiTuan(美团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);multi-agent(abstract)
AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。