arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2605.11567 2026-08-03 cs.CV 版本更新 89%

Dynamic Execution Commitment of Vision-Language-Action Models

视觉-语言-动作模型的动态执行承诺

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu

机构 * University of Adelaide(阿德莱德大学) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出A3机制,通过将动态执行承诺重新定义为自推测前缀验证问题,解决了视觉-语言-动作模型在动态或分布外情况下执行鲁棒性和推理吞吐量之间的平衡问题。

Comments code is available at https://inceptionwang.github.io/A3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 89%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新 89%

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交 89%

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31160 2026-07-01 cs.CV 新提交 89%

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

面向自动驾驶中高效视觉-语言-动作模型的推理感知推测解码

Anh Dung Dinh, Simon Khan, Flora Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出推理感知推测解码框架,通过例程推理器处理常规推理、审慎推理器处理异常情况,结合FlatRoPE和AARL技术,将推理步骤运行时间降低约4倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO 89%

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交 89%

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 89%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24815 2026-06-25 cs.SE cs.RO 新提交 89%

MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

MANGO: 面向视觉-语言-动作模型的自动化多智能体测试预言生成

Pablo Valle, Shaukat Ali, Aitor Arrieta, Lionel Briand

机构 * Mondragon University(蒙得龙大学) Simula Research Laboratory(Simula研究实验室) University of Ottawa(渥太华大学) Research Ireland Lero Centre for Software(爱尔兰Lero软件研究中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出MANGO多智能体框架,从自然语言任务描述自动生成细粒度测试预言,通过协作智能体迭代精炼,在机器人基准测试中有效检测故障并定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21493 2026-06-23 cs.CV cs.ET 新提交 89%

Semi-Supervised Vision-Language-Action Model

半监督视觉-语言-动作模型

Hongyang He, Jiuming Liu, Victor Sanchez

机构 * University of Warwick(华威大学) University of Cambridge(剑桥大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出SemiVLA框架,通过自蒸馏教师-学生网络利用伪动作标签适应新环境,在10%标注轨迹下提升LIBERO任务成功率8.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-06-23 cs.RO 新提交 89%

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18464 2026-06-15 cs.LG 版本更新 89%

AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models

AcceRL: 面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架

Chengxuan Lu, Shukuan Wang, Yanjie Li, Yingying Fang, Huoyan Wang, Tian Zhang, Wei Liu, Shiji Jin, Fuyuan Qian, Peiming Li, Chao Xu, Baigui Sun, Yang Liu

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(伊罗科技沃尔夫1069b实验室,三一集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.LG

AI总结 提出AcceRL框架,通过物理隔离环境交互、模型推理和梯度更新实现分布式异步强化学习,消除同步系统的空闲气泡,提升硬件利用率,并支持即插即用的世界模型集成,在LIBERO任务上实现2.4倍吞吐加速和200倍样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00321 2026-06-11 cs.RO 版本更新 89%

Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

具身可解释性:将因果理解与视觉-语言-动作模型的泛化联系起来

Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer, Shigang Yue, Hongbiao Dong, Zhou Daniel Hao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出干预显著性评分(ISS)和干扰质量比(NMR),通过干预掩码估计视觉区域对动作预测的因果影响,并量化对任务无关特征的归因,实验表明NMR可预测泛化行为,ISS比现有方法提供更忠实的解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08684 2026-06-09 cs.CV 新提交 89%

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

BLUE:迈向自动驾驶高效视觉-语言-动作模型中更好的语言使用

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

机构 * Bosch Research(博世研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出BLUE方法,通过轻量门控机制在视觉-语言-动作模型中按帧决定是否激活语言生成,实现性能提升和2.54倍推理加速。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08288 2026-06-09 cs.RO 新提交 89%

MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model

MotionVLA: 将几何运动注入视觉-语言-动作模型

Shanglin Yuan, Weiheng Zhao, Xianda Guo, Wei Sui, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) D-Robotics(大疆机器人) Wuhan University(武汉大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出MotionVLA,通过运动历史接口将过去视频窗口转换为紧凑的连续轨迹场令牌,解决长程操作中的几何漂移和时间线索碎片化问题,提升动作平滑性和执行效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22238 2026-06-09 cs.RO 版本更新 89%

CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models

CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型

Khoa Vo, Sieu Tran, Taisei Hanyu, Yuki Ikebe, Duy Nguyen, Nghi D. Q. Bui, Minh Vu, Anthony Gunderman, Chase Rainwater, Anh Nguyen, Ngan Le

机构 * University of Arkansas(亚拉巴马大学) Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学) Center of AI Research, VinUniversity(Vin大学人工智能研究中心) TU Wien(维也纳技术大学) University of Liverpool(利物浦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 CodeGraphVLP结合语义图状态与可执行代码规划器,提升非马尔可夫长周期任务的视觉语言动作执行效率,降低规划延迟并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07107 2026-06-08 cs.RO 新提交 89%

Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models

粗到细控制:面向视觉-语言-动作模型的行动令牌规划

Jinhao Wu, Shiduo Zhang, Yicheng Liu, Xiaopeng Yu, Sixian Li, Siyin Wang, Hang Zhao, Jing Huo, Yang Gao, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出Coarse-to-Control框架,在动作令牌空间中引入原生规划,通过先预测粗粒度动作令牌序列再生成可执行动作,提升长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06147 2026-06-05 cs.AI 89%

WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation

WorldFly: 基于世界模型的视觉-语言-动作模型用于无人机导航

Shengtao Zheng, Kai Li, Weichen Zhang, Yu Meng, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.AI

AI总结 提出WorldFly框架,通过双分支耦合流匹配机制联合生成未来视频预测和导航动作,解决城市峡谷中严重遮挡和视角剧变下的无人机导航问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00269 2026-06-02 cs.AI 89%

Closed-Loop Neural Activation Control in Vision-Language-Action Models

视觉-语言-动作模型中的闭环神经激活控制

Abhijith Babu, Ramneet Kaur, Nathaniel D. Bastian, Olivera Kotevska, Susmit Jha, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Florida International University(佛罗里达国际大学) SRI International(美国桑尼沃德国际研究机构) United States Military Academy(美国军事学院) Oak Ridge National Laboratory(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.AI

AI总结 提出CTRL-STEER闭环框架,通过自适应时变控制信号替代固定干预系数,实现更稳定的概念调节和任务成功率。

Comments Accepted at the IEEE/CVF CVPR 2026 Workshop on Visual Concepts (VisCon). 25 pages, 8 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25889 2026-06-02 cs.CR cs.LG 89%

Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models

能力与鲁棒性不可兼得:视觉-语言-动作模型的信息论界

Jianwei Tai

机构 * Jianwei Tai(Tai Jianwei)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.LG

AI总结 本文证明视觉-语言-动作模型的能力与鲁棒性之间存在信息论权衡,能力与鲁棒性之和受限于任务熵与对抗信道容量之和,并通过实验验证了该界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22671 2026-06-02 cs.CV 89%

From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model

从抽象到实例化:学习视觉-语言-动作模型的行为表示

Bing Hu, Zaijing Li, Rui Shao, Junda Chen, April Hua Liu, Wei-Shi Zheng, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) PengCheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Shanghai University of Finance(上海财经大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出BehaviorVLA框架,通过因果Mamba架构的视觉运动行为编码器和相位条件行为解码器学习时间一致的行为表示,在分布偏移下实现鲁棒操作,在多个基准上达到最优成功率并展现数据效率。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01766 2026-05-28 cs.RO 89%

Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models

神经隐式动作场:从离散路点到连续函数的视觉-语言-动作模型

Haoyun Liu, Jianzhuang Zhao, Xinyuan Chang, Tianle Shi, Chuanzhang Meng, Jiayuan Tan, Feng Xiong, Tong Lin, Dongjie Huo, Mu Xu, SongLin Dong, Zhiheng Ma, Yihong Gong, Sheng Zhong

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳大学计算微电子学院) Guangdong Provincial Key Laboratory of Computility Microelectronics(广东省计算微电子重点实验室) Amap, Alibaba Group(阿里集团Amap) Shenzhen University(深圳大学) Xi'an Jiaotong University(西安交通大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型预测离散动作路点与物理运动连续性不匹配的问题,提出神经隐式动作场(NIAF),通过将动作表示从离散路点重构为连续函数,实现任意时间分辨率的连续动作流形合成,支持解析求导和显式速度监督,提升控制平滑性和物理合理性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19678 2026-05-20 cs.RO 89%

RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models

RoVLA: 多一致性约束用于鲁棒的视觉-语言-动作模型

Jingzhou Luo, Yifan Wen, Yongjie Bai, Xinshuai Song, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出RoVLA框架,通过多一致性约束提升视觉-语言-动作模型的鲁棒性,通过指令语义、轨迹演变和观察扰动三种互补变换增强模型的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00600 2026-05-20 cs.RO cs.AI cs.CV cs.LG 89%

Hybrid Training for Vision-Language-Action Models

视觉-语言-动作模型的混合训练

Pietro Mazzaglia, Cansu Sancaktar, Markus Peschl, Daniel Dijkman

机构 * Qualcomm AI Research(高通AI研究)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17517 2026-05-19 cs.RO 89%

AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment

AffordVLA: 通过隐式特征对齐将 affordance 表示注入到视觉-语言-动作模型中

Weijie Kong, Zhian Su, Wei Yu, Huixu Dong

机构 * Grasp Lab, School of Mechanical Engineering of Zhejiang University(浙大机械工程学院抓取实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出 AffordVLA 框架,通过隐式特征对齐将以操作为中心的 affordance 表示注入到视觉-语言-动作模型中,以提升动作准确性,实验表明其在仿真和现实中的表现优于现有方法。

Comments 13pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08434 2026-05-13 cs.RO 89%

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

失败前进:面向视觉-语言-动作模型的自适应失败信息学习

Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出AFIL框架,通过利用失败轨迹作为负向指导,提升视觉-语言-动作模型在机器人操作中的鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 89%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10993 2026-05-13 cs.RO 89%

ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

ECHO:面向视觉-语言-动作模型的连续层次记忆

Yanbin Hu, Jin Cui, Jiayi Lu, Ruixuan Yang, Jun Ye, Boran Zhao, Xingyu Chen, Xuguang Lan, Pengju Ren

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室,人工智能与机器人研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ECHO框架,通过连续层次空间提升视觉-语言-动作模型在长周期任务中的表现,实现高效经验检索与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10925 2026-05-12 cs.RO 89%

PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models

PriorVLA: 为视觉-语言-动作模型保留先验进行适应

Xinyu Guo, Bin Xie, Wei Chai, Xianchi Deng, Tiancai Wang, Zhengxing Wu, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dexmal University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 PriorVLA通过保留预训练先验和学习有效适应方法,在机器人操作任务中实现了比全微调和现有基线更好的性能,特别是在分布外和少样本情况下表现更优。

Comments 32 pages. Project page: https://priorvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 89%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏