arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-14 至 2026-07-14 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 8 篇

2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新 92%

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 90%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 89%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 88%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27677 2026-07-14 cs.RO cs.CV 版本更新 81%

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

DIM-WAM:基于多样化历史事件记忆的世界-动作建模

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Jiabing Yang, Zhaowen Li, Yan Huang, Liang Wang, Peng Su

机构 * NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) Yinwang Intelligent Technology(银旺智能科技) FiveAges(五龄科技)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出DIM-WAM,一种记忆增强的世界-动作模型,通过多尺度历史上下文、局部未来动态和全局任务进度解决长期遗忘问题,在RMBench和真实机器人任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07206 2026-07-14 cs.LG math.OC 版本更新 57%

Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions

几何-非几何优化器演算:一种用于可达梯度方法的模块化语言

Zavier Li

机构 * Xidian University(西安电子科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 研究提出几何-非几何优化器演算,用于审查可达梯度方法。核心方法是定义模块及相关机制,证明方向表达定理等。主要贡献是给出方向级诊断,将设计问题转为帕累托优化,还提升残差复杂性并提供诊断原型证据。

Comments 34 pages. Complete proofs, controlled real-data experiments, and reproducibility details are included

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05421 2026-07-14 eess.SY cs.SY 版本更新 50%

Game Theory in Formula 1: From Physical to Strategic Interactions

一级方程式赛车中的博弈论:从物理交互到战略交互

Giona Fieni, Marc-Philippe Neumann, Francesca Furia, Alessandro Caucino, Alberto Cerofolini, Vittorio Ravaglioli, Christopher H. Onder

专题命中 VLA模型 :action model(abstract)

AI总结 研究多智能体赛车动力学,提出优化框架,纳入物理交互模型与智能体最优响应。将最短圈速问题描述为博弈,用卡罗需-库恩-塔克条件得非线性规划结构,引入算法细化解,通过案例研究分析策略,缩小理论与应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2605.23568 2026-07-14 cs.RO cs.SY eess.SY 版本更新 70%

TactileReflex: Noise-Statistics-Driven Vision-Tactile Reflex Control for Force-Sensitive Manipulation

TactileReflex:基于噪声统计的视觉-触觉反射控制用于力敏感操作

Ziyan Feng, Yulong Fu, Zheng Li, Yuxin He, Jieji Ren, Yudong Zhong, Lujia Wang, Jinni Zhou, Qiang Nie

机构 * Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究所,香港科学与技术大学(广州)) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 针对易变形容器操作中的力控制难题,提出基于噪声统计的标定驱动反射控制范式,利用视觉触觉传感器提取图像级代理并实现约12Hz的优先反射通道,无需外部标定或手动调参。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏