机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学)
;
Qwen Team(通义实验室)
;
Beijing Institute of Technology(北京理工大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI
ERQA-Plus:具身AI推理的诊断基准
Hong Yang, Basura Fernando
机构
*
Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation
GSAM: 一种通用且安全的铰接物体操作机器人框架
Beichen Shao, Mengying Xie, Heng Su, Wanyi Zhang, Mingyan Li, Yan Ding, Fausto Giunchiglia, Chao Chen
机构
*
College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院)
;
Lumos Robotics, China(Lumos机器人中国)
;
Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学)
;
Fudan University, China(复旦大学)
;
Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试
Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao
机构
*
The University of New South Wales(新南威尔士大学)
;
The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Xinjiang University(新疆大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
视觉推理
:VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
Tencent Hunyuan(腾讯文元)
;
University of Maryland, College Park(马里兰大学 College Park 分校)
;
University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院)
;
Huazhong University of Science and Technology(华中科技大学)
;
National University of Singapore(新加坡国立大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
机构
*
Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS))
;
Jilin University (JLU)(吉林大学(JLU))
;
Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT))
;
University of the Chinese Academy of Sciences(中国科学院大学)
A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video
一种用于无训练代理推理的4D表示
Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab
机构
*
Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所)
;
Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中
视觉推理
:vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
CommentsICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL). 10 pages, 3 figures, 6 tables. Our model, training code and dataset will be at https://github.com/aybora/FewShotReasoning
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
Ziyue Wang, Yurui Dong, Fuwen Luo, Minyuan Ruan, Zhili Cheng, Chi Chen, Peng Li, Yang Liu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国)
;
Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)
;
School of Management, Fudan University, Shanghai, China(管理学院,复旦大学,上海,中国)
专题命中
视觉推理
:visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li
机构
*
Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心)
;
Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
机构
*
National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)
;
Tsinghua University(清华大学)
;
Chinese Academy of Sciences(中国科学院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Renmin University of China(中国人民大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV、cs.AI