Is VLA Reasoning Faithful? Probing Safety of Chain-of-Causation in Autonomous Driving Models
VLA 推理是否忠实?自动驾驶模型中因果链的安全性探究
Nicanor Mayumu, Xiaoheng Deng, Patrick Mukala
机构
*
School of Computer Science and Engineering(计算机科学与工程学院)
;
Central South University(中南大学)
;
School of Computer Science(计算机科学学院)
;
University of Wollongong in Dubai(迪拜大学)
机构
*
Nanyang Technological University(南洋理工大学)
;
Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心)
;
Allen Institute for AI(艾伦人工智能研究所)
;
University of Washington(华盛顿大学)
Teaching Vision-Language-Action Models What to See and Where to Look
教视觉-语言-动作模型看什么和看哪里
Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao
机构
*
School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)
;
National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
DiDi(滴滴出行)
;
State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)
;
School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
;
School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer
VLSA: 具有即插即用安全约束层的视觉-语言-动作模型
Songqiao Hu, Zeyi Liu, Shuang Liu, Jun Cen, Zihan Meng, Shihefeng Wang, Xiang Li, Xiao He
机构
*
Department of Automation, Tsinghua University(清华大学自动化系)
;
Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能与机器人研究院)
;
TetraBOT
;
DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)
SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics
SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估基准
Jiashuo Sun, Yue He, Wenxuan Liu, Tao Mao, Jiazheng Wang, Xiang Chen, Min Liu
机构
*
the National Engineering Research Center of Robot Visual Perception and Control Technology, China(中国机器人视觉感知与控制技术国家工程研究中心)
;
the national graduate college for elite engineers, Hunan University, Hunan, China(湖南大学精英工程师国家研究生学院)
;
the School of Artificial Intelligence and Robotics, Hunan University, Hunan, China(湖南大学人工智能与机器人学院)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
StereoVLA:利用立体视觉增强视觉-语言-动作模型
Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang
机构
*
Galbot
;
CFCS, School of CS, Peking University(北京大学计算机学院CFCS)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
The University of Hong Kong(香港大学)
;
Xiamen University Malaysia(厦门大学马来西亚分校)
;
Southern University of Science and Technology(南方科技大学)
EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models
EquiVLA: 旋转等变视觉-语言-动作模型的通用框架
Thien-Loc Ha, Quang-Tan Nguyen, Trong-Bao Ho, Long Dinh, Minh Duc Nguyen, Gia-Binh Nguyen, Pham Tri Quang, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien
机构
*
VinRobotics
;
VinUniversity
;
DFKI(德国人工智能研究中心)
;
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(国际马克斯·普朗克智能系统研究学院)