机构
*
Fudan University(复旦大学)
;
Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)
;
Tianjin University(天津大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Tsinghua University(清华大学)
;
City University of Hong Kong(香港城市大学)
机构
*
Zhejiang University(浙江大学)
;
Hunan University(湖南大学)
;
Tianjin University(天津大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Jilin University(吉林大学)
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
在预测之前想象:用于视频事件预测的交错潜在视觉推理
Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
City University of Hong Kong(香港城市大学)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
University of Electronic Science and Technology of China(电子科技大学)
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试
Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao
机构
*
The University of New South Wales(新南威尔士大学)
;
The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Xinjiang University(新疆大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理
Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal
机构
*
Mila - Québec AI Institute(蒙特利尔AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
ServiceNow AI Research(ServiceNow人工智能研究)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
机构
*
College of AI, Tsinghua University(清华大学人工智能学院)
;
ByteDance(字节跳动)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
机构
*
Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室)
;
Beijing University of Posts(北京邮电大学)
;
Hong Kong University of Science(香港理工大学)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
增强视觉基础模型中的眼动推理以实现眼动跟随
Shijing Wang, Yaping Huang, Chaoqun Cui, David Wong, Yihua Cheng, Alexandros Neophytou, Hyung Jin Chang
机构
*
Beijing Jiaotong University(北京交通大学)
;
University of Birmingham(英国伯明翰大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部)
;
Microsoft, UK(微软公司(英国))
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Pengcheng Laboratory(鹏城实验室)
;
Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
;
Hainan University(海南大学)
;
University of California at Merced(加州大学默塞德分校)
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Tsinghua University(清华大学)
;
The University of Hong Kong(香港大学)
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
协同视见:基于多模态大语言模型的多机器人协作自体空间推理
Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool
机构
*
Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
;
Hunan University(湖南大学)
;
University of Oxford(牛津大学)
;
Zhejiang University(浙江大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Ant Group(蚂蚁集团)
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Guangzhou University(广州大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
HKUST(Guangzhou)(香港科技大学(广州))
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
SkyNative: 一种面向遥感视觉证据推理的原生多模态框架
Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Jiashun Zhu, Jiasen Hu, Lang Sun, Weipeng Zhang, Jiaqi Liu, Xu Na, Haoran Liu, Weijie Zhang, Bo Yang
机构
*
College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)
;
Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
GraphThinker: 通过事件图思维强化时间感知的视频推理
Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li
机构
*
Queen Mary University of London(伦敦玛丽女王大学)
;
Samsung AI Centre Cambridge(剑桥三星人工智能中心)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距
Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
机构
*
Tencent Youtu Lab(腾讯云图实验室)
;
Sichuan University(四川大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)