Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
协同视见:基于多模态大语言模型的多机器人协作自体空间推理
Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool
机构
*
Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
;
Hunan University(湖南大学)
;
University of Oxford(牛津大学)
;
Zhejiang University(浙江大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Ant Group(蚂蚁集团)
CommentsThe paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations
Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs
无参与的感知:LMMs中因果发现缺陷的剖析
Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Pengcheng Laboratory(鹏城实验室)
;
National University of Singapore(新加坡国立大学)
;
Peking University(北京大学)
;
Harvard University(哈佛大学)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
基于检测器的视频大语言模型用于高效的时空定位
Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Trento(特伦特大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hong Kong University of Science and Technology(香港科技大学)
;
ZTE Corporation(中兴通讯)
Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception
对齐后再适应:重新思考4D感知中的参数高效迁移学习
Yiding Sun, Jihua Zhu, Haozhe Cheng, Chaoyi Lu, Zhichuan Yang, Lin Chen, Yaonan Wang
机构
*
School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)
;
State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室)
;
School of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院)
;
National Engineering Research Center for Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心)
Multi-Scale Contrastive Learning for Video Temporal Grounding
多尺度对比学习用于视频时间定位
Thong Thanh Nguyen, Yi Bin, Xiaobao Wu, Zhiyuan Hu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu
机构
*
Institute of Data Science (IDS), National University of Singapore(数据科学研究所(IDS),新加坡国立大学)
;
Tongji University(同济大学)
;
Nanyang Technological University (NTU)(南洋理工大学)
SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos
SurgMotion: 一种用于外科视频通用理解的视频原生基础模型
Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei
机构
*
Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国)
;
Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑)
;
Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国)
;
Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
;
Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)