Comments7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院)
;
Unicom Data Intelligence, China Unicom(中国unicom数据智能)
机构
*
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
超越识别:评估视觉语言模型中的视觉视角理解
Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński
机构
*
University of Warsaw(华沙大学)
;
Polish Academy of Sciences(波兰科学院)
;
Stanford University(斯坦福大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
IDEAS NCBR
;
Lute
专题命中
视觉推理
:vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室)
;
Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
DeepSport: 一种基于代理强化学习的多模态大语言模型,用于通过主动推理实现综合体育视频理解
Junbo Zou, Haotian Xia, Zhen Ye, Shengjie Zhang, Christopher Lai, Vicente Ordonez, Weining Shen, Hanjie Chen
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Rice University(Rice大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of California, Irvine(加州大学 Irvine分校)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构
*
University of Maryland(马里兰大学)
;
Brown University(布朗大学)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
Adobe
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Southern California(南加州大学)
;
NVIDIA
专题命中
视觉推理
:vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG