arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-28 至 2026-04-28 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2603.20711 2026-04-28 cs.DC cs.LG cs.RO 92%

RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models

RoboECC: 多因素感知的边缘-云计算协同部署用于VLA模型

Zihao Zheng, Hangyu Cao, Jiayu Chen, Sicheng Tian, Chenyue Li, Maoliang Li, Xinhao Sun, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, South China University of Technology, Guangzhou, China(华南理工大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of EECS, Peking University, Beijing, China(北京大学电子工程与科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出RoboECC框架,通过模型-硬件协同分割策略和网络感知部署调整方法,解决VLA模型在边缘-云计算协同部署中的分割点识别和网络波动问题,实验显示其在效率提升与资源消耗之间取得良好平衡。

Comments This paper has been accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01581 2026-04-28 cs.RO cs.LG 91%

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV:基于运动学的具身VLA模型的推测解码

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan), Wuhan, China(中国地质大学(武汉)计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 本文提出KERV框架,结合token域和运动学域预测,通过运动学卡尔曼滤波和动态调整策略提升VLA模型的推理速度,实验显示在多种任务中加速27%-37%且成功率损失极小。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23121 2026-04-28 cs.RO cs.CV 91%

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

打破锁定:在低数据VLA后训练中保持可引导性

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DeLock方法,通过保留视觉 grounding 和测试时对比提示指导,解决VLA策略在低数据后训练中因过度专业化导致的概念和空间锁定问题,实验证明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 91%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23272 2026-04-28 cs.RO 90%

Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models

模块化感觉流:整合物理反馈在视觉-语言-动作模型中

Jimin Lee, Huiwon Jang, Myungkyu Koo, Jungwoo Park, Jinwoo Shin

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出MoSS框架,通过模块化感觉流整合多种物理信号,提升视觉-语言-动作模型的行动预测能力。

Comments 14 pages, 8 figures, Project page: https://jiminlx.github.io/MoSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI 90%

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17573 2026-04-28 cs.RO cs.DB cs.LG 90%

HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness

HeiSD:具有运动意识的具身视觉-语言-动作模型的混合推测解码

Zihao Zheng, Zhihao Mao, Sicheng Tian, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of EECS, Peking University(北京大学电子工程与科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出HeiSD框架,结合draft-based和retrieval-based推测解码方法,通过验证跳过机制和序列放松接受策略提升效率,并引入基于运动的融合度量确定混合边界,实验证明在仿真和现实场景中均实现2.45倍以上的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24086 2026-04-28 cs.RO cs.AI 89%

AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation

AsyncShield: 一种异步云边协同的边缘适配器用于异步云边VLA导航

Kai Yang, Zedong Chu, Yingnan Guo, Zhengbo Wang, Shichao Xie, Yanfen Shen, Xiaolong Wu, Xing Li, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团地图部门) Beijing Jiaotong University(北京交通大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出AsyncShield,通过确定性物理白盒空间映射替代传统黑盒时间序列预测,解决云边异步导航中时空对齐问题,提升导航鲁棒性和安全性。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 87%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 84%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17834 2026-04-28 cs.RO cs.AI 79%

Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control

生成控制作为优化:用于自适应和鲁棒机器人控制的时间无条件流匹配

Zunzhe Zhang, Runhan Huang, Yicheng Liu, Shaoting Zhu, Linzhan Mou, Hang Zhao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Department of Computer Science, Princeton University, New Jersey, US(普林斯顿大学计算机科学系) Galaxea Inc., Beijing, China(Galaxea公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 GeCO通过将动作合成转化为迭代优化,解决了传统流匹配在状态复杂度上计算效率低的问题,实现了自适应的计算分配和无监督的安全检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24188 2026-04-28 cs.RO cs.GR 74%

Generalizable Friction Coefficient Estimation via Material Embedding and Proxy Interaction Modeling

通过材料嵌入和代理交互建模实现通用摩擦系数估计

Zhendong Wang, Huamin Wang

机构 * Style3D Research(Style3D研究院)

专题命中 VLA模型 :action model(title);分类 cs.RO

AI总结 本文提出基于代理材料的摩擦系数估计框架,通过材料嵌入和融合函数实现高效预测,减少实验成本并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17852 2026-04-28 math.DS 50%

Mean-field dynamics of attractive resource interaction: From uniform to aggregated states

吸引资源相互作用的均场动力学:从均匀到聚集状态

Oksana Satur

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了一种非线性离散动力系统,描述了资源在相互作用代理间的演变,分析了系统长期行为,证明了唯一固定点的存在,并揭示了参数导致均匀或聚集分布的机制。

Journal ref Math. Comput. Simul. 248 (2026) 213-238

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22970 2026-04-28 astro-ph.CO gr-qc 50%

Cosmological evolution of interacting dark energy with a CPL equation of state

相互作用暗能量的宇宙学演化:CPL方程状态参数化

Gerald Neumann, Nelson Videla, Dorian Araya

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了CPL参数化下的相互作用暗能量模型,通过解析解揭示暗物质演化结构,并利用贝叶斯分析显示Q=βHρ_de模型在AIC下表现更优,但BIC仍支持ΛCDM。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17187 2026-04-28 astro-ph.IM 50%

An Algorithm Architecture for Radio Interferometric Data Processing

射电干涉数据处理的算法架构

S. Bhatnagar, U. Rau, M. Hsieh, J. Kern, R. Xue

专题命中 VLA模型 :VLA(abstract)

AI总结 本文提出一种可扩展的算法架构,用于处理射电望远镜的干涉数据,通过数学优化方法整合校准与成像算法,实现跨平台高效处理。

Comments 16 pages, 7 figures, 2 tables

Journal ref AJ 170 246, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏