arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-01 至 2026-07-01 共收录 21 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 16 篇

2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新 94%

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交 94%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 91%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31846 2026-07-01 cs.RO cs.AI 新提交 90%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07100 2026-07-01 cs.CV cs.RO 新提交 90%

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

LARA: 视觉-语言-动作模型的潜在动作表示对齐

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出LARA框架,通过表示对齐联合优化潜在动作模型和视觉-语言-动作模型,利用人类视频数据提升机器人操作性能,在模拟和真实基准上平均提升约10%、5%和15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23721 2026-07-01 cs.RO cs.CV 版本更新 90%

StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation

StemVLA:一种融合未来3D空间几何知识与4D历史表示的开源视觉-语言-动作模型

Jiasong Xiao, Yutao She, Kai Li, Yuyang Sha, Ziang Cheng

机构 * Ricoh Software Research Center(理光软件研究中心) YZH Engineering Technology (Beijing) Co., Ltd.(易智赫工程技术(北京)有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出StemVLA框架,通过显式建模未来3D空间结构和历史4D时空表示,提升机器人操作任务中的空间推理与长时决策能力,在LIBERO基准上平均准确率达92.0%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交 89%

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31160 2026-07-01 cs.CV 新提交 89%

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

面向自动驾驶中高效视觉-语言-动作模型的推理感知推测解码

Anh Dung Dinh, Simon Khan, Flora Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出推理感知推测解码框架,通过例程推理器处理常规推理、审慎推理器处理异常情况,结合FlatRoPE和AARL技术,将推理步骤运行时间降低约4倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25399 2026-07-01 cs.CV cs.RO 版本更新 89%

LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior

LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习

Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang

机构 * Southeast University(东南大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV

AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交 88%

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新 87%

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31144 2026-07-01 cs.RO cs.AI 新提交 86%

A Modular Vision-Language-Action Robotics Framework for Indoor Environments

面向室内环境的模块化视觉-语言-动作机器人框架

Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究部) CMU(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出模块化架构,集成环境建图、问题处理和导航,通过双流并行处理(语义体素建图与语言分类)实现自然语言指令驱动的自主任务执行。

Comments IEEE IROS 2025 Workshop on Generative AI for Robotics and Smart Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31101 2026-07-01 cs.RO 新提交 80%

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

基于合成先验的世界-动作模型的高效仿真到现实迁移

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

机构 * Purdue University(普渡大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。

Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交 77%

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31177 2026-07-01 cs.CV 新提交 57%

GaussianMap: Learning Gaussian Representation for Multi-Sensor Online HD Map Construction

GaussianMap: 学习高斯表示用于多传感器在线高清地图构建

Hongyu Lyu, Julie Stephany Berrio Perez, Mao Shan, Stewart Worrall

机构 * The University of Sydney, Australian Centre for Robotics(悉尼大学澳大利亚机器人中心) The University of Queensland(昆士兰大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出GaussianMap框架,利用自适应高斯表示代替固定分辨率BEV网格,通过高斯编码器与多传感器融合,实现高效在线高清地图构建,在nuScenes和Argoverse 2上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22111 2026-07-01 cond-mat.soft 新提交 50%

On the statistical theory of strong electrolytes and high-temperature plasmas: new applications of the work of Yukhnovskii and Kelbg

关于强电解质和高温等离子体的统计理论:Yukhnovskii和Kelbg工作的新应用

W. Ebeling, M. Holovko

专题命中 VLA模型 :action model(abstract)

AI总结 本文基于Yukhnovskii和Kelbg的统计物理方法,利用指数相互作用模型研究强电解质和高温等离子体,揭示了库仑系统的结构相似性,并预测了高密度下的结构转变。

Comments 19 pages, 4 figures

Journal ref Condens. Matter Phys., vol. 29, no. 2, p. 23501, Jun. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2606.31132 2026-07-01 cs.RO 新提交 70%

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04991 2026-07-01 cs.RO 版本更新 57%

Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory

小波策略:基于世界先验记忆的尺度域模仿学习

Changchuan Yang, Haoxuan Xu, Yuhang Dong, Guanzhong Tian, Haizhou Ge, Hongrui Zhu

机构 * Zhejiang University(浙江大学) Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2606.31958 2026-07-01 cs.RO 新提交 70%

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

基于语义强化学习的通用机器人策略自适应

Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine

机构 * U.C. Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出语义动作强化学习(SARL),通过在线交互优化语言提示空间,利用通用策略的预训练技能解决复杂长时任务,显著优于现有方法。

Comments Website: https://semantic-action-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28529 2026-07-01 cs.RO cs.AI cs.CV 版本更新 67%

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks

加速悖论:具身任务中推理速度与质量权衡的再思考

Yujin Wang, Junli Chen, Yixuan Li, Shunan Dong, Huazhong Yang, Yongpan Liu, Hongyang Jia

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出TISED分析框架,揭示具身任务中推理加速技术对任务级性能的悖论效应:静态任务中可能延长完成时间,动态任务中适度优化可提升成功率,且效果受硬件配置影响。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 数据集与评测 1 篇

2606.31993 2026-07-01 cs.RO 新提交 57%

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

OopsieVerse: 一个具有损伤感知仿真的机器人操作安全基准

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数据集与评测 :vision language action(abstract);分类 cs.RO

AI总结 提出OopsieVerse框架,通过DamageSim检测和量化接触力、温度等损伤信号,在OmniGibson和RoboCasa仿真器中实现损伤感知,用于安全策略学习与评估。

Comments Project website: https://robin-lab.cs.utexas.edu/oopsieverse/. The first two authors contributed equally; order decided by dice roll. Accepted to Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏