Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
Agent-X:评估视觉中心智能体任务中的深度多模态推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; University of Central Florida(中央佛罗里达大学) ; University of Oxford(牛津大学)
专题命中 规划决策 :agent(title,title_cn);agentic(title,abstract);tool use(abstract);tool-use(abstract)
AI总结 提出Agent-X基准,通过828个真实视觉任务和细粒度步骤评估框架,揭示当前模型在多步视觉推理中全链成功率低于50%的瓶颈。
Comments Accepted in International Conference of Learning Representations (ICLR 2026)