Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
推理时的自适应动作分块
Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat
机构
*
National University of Singapore(新加坡国立大学)
;
Shenzhen University of Advanced Technology(深圳理工大学)
;
Sangfor Technologies Inc.(深信服科技股份有限公司)
;
Mininglamp Technology(明略科技)
;
Shenzhen Technology University(深圳技术大学)
;
City University of Hong Kong(香港城市大学)
Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models
基于概念的词典学习用于推理时的安全性在视觉语言动作模型中
Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang
机构
*
Beijing Jiaotong University(北京交通大学)
;
Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室)
;
King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学)
;
University of Auckland(奥克兰大学)
;
RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心)
;
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中
VLA模型
:vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models
ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型
Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi
机构
*
School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国)
;
School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)
Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward
通过时间离散和时间连续速度前馈实现视觉-语言-动作模型中的动态跟踪
Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard
机构
*
Siemens Foundational Technologies(西门子基础技术)
;
Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)
;
Simplexity Robotics(Simplexity机器人公司)
;
The Chinese University of Hong Kong(香港中文大学)
DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference
DepthCache: 一种基于深度的无训练视觉标记融合方法,用于视觉-语言-动作模型推理
Yuquan Li, Lianjie Ma, Han Ding, Lijun Zhu
机构
*
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
;
School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)
机构
*
Southeast University(东南大学)
;
Purple Mountain Labs(紫金山实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Fudan University(复旦大学)
;
Shanghai Jiao Tong University(上海交通大学)
机构
*
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute of Automation(自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Artificial Intelligence(人工智能学院)
;
Peking University(北京大学)