arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-11 至 2026-06-11 共收录 21 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 21 篇

2606.12105 2026-06-11 cs.RO cs.CV cs.LG 新提交 94%

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

DAM-VLA: 解耦异步多模态视觉语言动作模型

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

机构 * Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT)(直觉机器人实验室,卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute of Germany(德国机器人研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 针对VLA模型同步时钟与物理交互中不同模态频率不匹配的问题,提出DAM-VLA,通过解耦各模态时间处理、维护传感器速率更新的潜在缓冲区,并利用门控交叉注意力整合高频模态,在7个真实操作任务中平均成功率提升至95.2%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12299 2026-06-11 cs.RO cs.LG 新提交 94%

Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering

学习对你的VLA说什么:基本无害的视觉语言动作模型引导

Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 提出一个框架,通过交互式搜索语言序列改进闭环VLA任务性能,并学习一个改进头预测何时语言引导能提升性能,同时通过共形化防止有害干预。

Comments 22 pages, 14 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 92%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交 92%

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);language-conditioned robot(abstract)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08530 2026-06-11 cs.RO cs.AI 版本更新 91%

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation

GEAR-VLA:学习几何感知的动作表示以实现可泛化的机器人操作

Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出GEAR-VLA框架,通过粗到细的动作学习、语义对齐的3D集成和具身规范化,学习统一的几何感知动作表示,实现跨物体、背景和机器人的泛化操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11618 2026-06-11 cs.IT math.IT 新提交 91%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 89%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00321 2026-06-11 cs.RO 版本更新 89%

Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

具身可解释性:将因果理解与视觉-语言-动作模型的泛化联系起来

Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer, Shigang Yue, Hongbiao Dong, Zhou Daniel Hao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出干预显著性评分(ISS)和干扰质量比(NMR),通过干预掩码估计视觉区域对动作预测的因果影响,并量化对任务无关特征的归因,实验表明NMR可预测泛化行为,ISS比现有方法提供更忠实的解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12352 2026-06-11 cs.RO cs.AI 新提交 89%

CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy

CHORUS: 基于单一VLA策略的去中心化多体协作

Ria Doshi, Tian Gao, Annie Chen, Chelsea Finn, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出CHORUS框架,利用预训练视觉-语言-动作模型的视觉运动先验,实现无需推理时通信的去中心化多机器人协作,在真实实验中显著优于基线。

Comments Project Website: https://chorus-model.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12396 2026-06-11 cs.CV cs.RO 新提交 88%

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

VLGA:用于自动驾驶的视觉-语言-几何-动作模型

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(Uber自动驾驶实验室) University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。

Comments Project page: https://yaojin17.github.io/VLGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11743 2026-06-11 cs.RO cs.GR cs.LG 新提交 86%

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

TacCoRL: 通过仿真将触觉反馈集成到视觉-语言-动作模型中

Siyu Ma, Yuqi Liang, Chang Yu, Yunuo Chen, Hao Su, Yixin Zhu, Yin Yang, Chenfanfu Jiang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Utah(犹他大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出TacCoRL框架,通过仿真与真实联合训练和强化学习,将触觉反馈注入视觉-语言-动作策略,在接触密集型任务中平均成功率提升22.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12366 2026-06-11 cs.RO 新提交 85%

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06904 2026-06-11 cs.RO cs.CV 版本更新 85%

ActionMap: Robot Policy Learning via Voxel Action Heatmap

ActionMap: 基于体素动作热图的机器人策略学习

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) NVIDIA(英伟达)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出ActionMap,一种将动作空间建模为体素热图的动作解码器,替代现有VLA模型中的单点预测器,在LIBERO仿真和真实Franka操作中提升性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11221 2026-06-11 cs.CV 新提交 84%

LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment

LAST: 通过Gromov-Wasserstein对齐连接视觉-语言与动作流形

Huaihai Lyu, Chaofan Chen, Yuheng Ji, Xiansheng Chen, Pengwei Wang, Shanghang Zhang, Changsheng Xu

机构 * National Engineering Laboratory for Intelligent Information Processing(智能信息处理国家级工程实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出LAST方法,通过李代数线性化和局部度量离散化,对齐视觉-语言语义几何与动作流形,解决异构空间不兼容问题,提升VLA模型收敛性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 82%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新 79%

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11986 2026-06-11 cs.HC 新提交 78%

Channels and Substrates: Distributed Cognition as an Interaction Model for Ubiquitous Analytics

通道与基质:作为普适分析交互模型的分布式认知

Niklas Elmqvist, Panagiotis D. Ritsos, Peter W. S. Butcher

专题命中 VLA模型 :action model(title,abstract)

AI总结 针对跨设备和普适分析中交互模型不匹配的问题,提出基于分布式认知的通道与基质框架,将交互建模为表征状态在基质间的传播,并通过重分析多个系统验证其有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22670 2026-06-11 physics.comp-ph 版本更新 71%

A survey of interlayer interaction models for graphene and other 2D materials

石墨烯及其他二维材料层间相互作用模型综述

Gourav Yadav, Shakti S. Gupta, Roger A. Sauer

专题命中 VLA模型 :action model(title)

AI总结 综述了描述二维材料间范德华相互作用的力学模型,涵盖连续弹性体与离散晶体材料,重点讨论了法向和切向接触模型、外部载荷及尺度变化对基态构型和摩擦接触行为的影响,并分析了多尺度建模中降低计算成本的策略。

Comments 55 pages, 25 figures

Journal ref Adv. Mater. Interfaces (2026), e70553

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03429 2026-06-11 astro-ph.HE astro-ph.SR 版本更新 67%

Milliarcsecond-scale spectrum of the persistent radio source associated with FRB 20190417A and constraints for FRB 20181030A

与FRB 20190417A相关的持续射电源的VLBI谱

G. Bruni, L. Piro, Y. -P. Yang, L. Nicastro, A. Rossi, E. Palazzi, E. Maiorano, S. Savaglio, B. Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用EVN在5和8 GHz观测,确认FRB 20190417A的致密射电源具有非热性质和平坦谱(α=-0.19±0.29),支持星云起源,并限制FRB 20181030A的候选PRS具有陡谱。

Comments Accepted for publication in A&A Letters

Journal ref A&A 710, L31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23130 2026-06-11 cs.HC cs.CR 版本更新 50%

From Preventive to Reactive: How AI Coding Assistants Transform Developers' Security Awareness

从预防到反应:AI编程助手如何改变开发者的安全意识

Faisal Haque Bappy, Tahrim Hossain, Sidratul Muntaher Meheraj, Annoor Sharara Akhand, Tasfia Tabassum, Tarannum Shaila Zaman, Raiful Hasan, Tariqul Islam

专题命中 VLA模型 :action model(abstract)

AI总结 通过访谈和观察15名专业开发者,发现AI编程助手将安全思考从编码阶段转移到审查阶段,导致从预防性安全转向反应性安全,并揭示了安全意识与行为脱节的现象。

Comments This paper has been accepted at the 2026 Symposium on Usable Privacy and Security (SOUPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09702 2026-06-11 cond-mat.mes-hall cond-mat.str-el 版本更新 50%

Non-Abelian Fibonacci quantum Hall states in 4-layer rhombohedral stacked graphene

四层菱方堆叠石墨烯中的非阿贝尔斐波那契量子霍尔态

Abigail Timmel, Xiao-Gang Wen

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究在菱方堆叠四层石墨烯中实现非阿贝尔斐波那契分数量子霍尔态的条件,通过调控磁场和位移场,在特定参数范围内稳定该态,并拓展到五层和三层石墨烯中的其他拓扑态。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏