Mantis: Mamba-native Tuning is Efficient for 3D Point Cloud Foundation Models
Mantis:Mamba原生微调在3D点云基础模型中的高效性
Zihao Guo, Jihua Zhu, Jian Liu, Ajmal Saeed Mian
机构
*
Xi’an Jiaotong University(西安交通大学)
;
School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
;
University of Western Australia(西澳大学)
机构
*
Department of Statistical Sciences, University of Padua(帕多瓦大学统计科学系)
;
School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院工业与系统工程学院)
机构
*
College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
;
Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
机构
*
Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能制造重点实验室,先进工程学院,大湾大学)
;
Chair of Applied Statistics, Technische Universität Dresden(应用统计学教授职位,德累斯顿技术大学)
;
Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据解析与人工智能中心(ScaDS.AI))
;
College of Automation, Guangdong University of Technology(自动化学院,广东技术大学)
专题命中
点云
:point cloud(abstract);分类 cs.CV、cs.RO
AI总结
本文提出MTA-RL框架,通过多模态Transformer-based 3D affordances和强化学习实现可靠的城市自动驾驶,提升样本效率和稳定性,优于现有基线方法。
机构
*
The Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing(中国科学院航空航天信息研究所,北京)
;
The School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing(中国科学院大学电子电气与通信工程学院,北京)
;
The Department of Computer Science, City University of Hong Kong, Hong Kong, SAR, China(香港城市大学计算机科学系,香港特别行政区,中国)
Dong-Yang Li, Wang Zhao, Yuxin Chen, Wenbo Hu, Meng-Hao Guo, Fang-Lue Zhang, Ying Shan, Shi-Min Hu
机构
*
BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系BNRist)
;
Tencent ARC Lab(腾讯ARC实验室)
;
Victoria University of Wellington(惠灵顿维多利亚大学)
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?
Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez
机构
*
Computational Intelligence and Operations Laboratory(计算智能与运筹实验室)
;
Shahjalal University of Science and Technology(沙赫jalal科技大学)
;
BRAC University(BRAC大学)
;
North South University(北南大学)
;
Monash University(墨尔本大学)
;
Qatar Computing Research Institute(卡塔尔计算研究院)