机构
*
The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)
;
School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院)
;
School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院)
;
State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching
通过自适应视觉令牌缓存学习加速视觉-语言-动作模型
Yujie Wei, Jiahan Fan, Jiyu Guo, Ruichen Zhen, Rui Shao, Xiu Su, Zeke Xie, Shuo Yang
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院)
;
Central South University(中南大学)
;
HKUST(GZ)(香港科技大学(广州))
Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning
一次注入,后期存活:向视觉-语言-动作模型注入后门以在下游微调中持续存在
Jianyi Zhou, Yujie Wei, Ruichen Zhen, Bo Zhao, Xiaobo Xia, Rui Shao, Xiu Su, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Meituan Academy of Robotics Shenzhen, Meituan(美团机器人深圳研究院)
;
Shanghai Jiaotong University(上海交通大学)
;
National University of Singapore(新加坡国立大学)
;
Central South University(中南大学)
机构
*
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Infinigence AI
;
Zhongguancun Academy(中关村学院)
Benchmarking the Generality of Vision-Language-Action Models
对视觉-语言-动作模型通用性的基准测试
Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang
机构
*
Manifold Research
;
Metarch AI
;
Georgia Tech(佐治亚理工学院)
;
Tufts University(塔夫茨大学)
;
Northeastern University(东北大学)
;
Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼)
;
Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)
专题命中
VLA模型
:action model(title,abstract);vision-language-action(title);vision language action(abstract);分类 cs.LG
Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩
Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu
机构
*
College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学)
;
Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学)
;
College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)
Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops
面向选择性机器人拆解的视觉-语言-动作模型:以从台式机中提取关键部件的案例研究
Chang Liu, Sibo Tian, Sara Behdad, Xiao Liang, Minghui Zheng
机构
*
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学)
;
Engineering School of Sustainable Infrastructure & Environment, University of Florida(可持续基础设施与环境工程学院,佛罗里达大学)
;
Zachry Department of Civil and Environmental Engineering, Texas A&M University(土木与环境工程系,德克萨斯A&M大学)
机构
*
The Institute of Robotics and Automatic Information System(机器人与自动信息系统研究所)
;
Tianjin Key Laboratory of Intelligent Robotics(智能机器人天津重点实验室)
;
TBI Center, Nankai University, Tianjin 300350, China(南开大学天津中心)
;
Faculty of Robot Science and Engineering, Northeastern University, Shenyang 110819, China(机器人科学与工程学院)
;
The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室)
;
Centre for Artificial Intelligence(人工智能中心)
;
Department of Electromechanical Engineering, University of Macau, Macau SAR, China(机电工程系,澳门大学)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
University of Oxford(牛津大学)
;
Xi’an Jiaotong University(西安交通大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
City University of Hong Kong(香港城市大学)
;
Beijing University of Technology(北京理工大学)
;
Duke University(杜克大学)
;
X-Humanoid Project(X-Humanoid 项目)
专题命中
VLA模型
:vision language action(title,abstract);action model(title,abstract);分类 cs.CV
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
Fuhao Li, Wenxuan Song, Han Zhao, Jingbo Wang, Pengxiang Ding, Donglin Wang, Long Zeng, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Tsinghua University(清华大学)
;
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
South China University of Technology(华南理工大学)
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
Mingtong Dai, Lingbo Liu, Yongjie Bai, Yang Liu, Zhouxia Wang, Rui SU, Chunjie Chen, Liang Lin, Xinyu Wu
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
;
Peng Cheng Laboratory(鹏城实验室)
;
School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
X-Era AI Lab(X-Era人工智能实验室)
SeqVLA: Sequential Task Execution for Long-Horizon Manipulation with Completion-Aware Vision-Language-Action Model
Ran Yang, Zijian An, Lifeng ZHou, Yiming Feng
机构
*
Virginia Seafood Agricultural Research and Extension Center, and Department of Biological Systems Engineering, Virginia Tech(弗吉尼亚海产品农业研究中心及生物系统工程系,弗吉尼亚理工学院)
;
Department of Electrical and Computer Engineering, Drexel University(电气与计算机工程系,德雷塞尔大学)