arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-11 至 2026-06-11 共收录 10 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2606.08530 2026-06-11 cs.RO cs.AI 版本更新 91%

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation

GEAR-VLA:学习几何感知的动作表示以实现可泛化的机器人操作

Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出GEAR-VLA框架,通过粗到细的动作学习、语义对齐的3D集成和具身规范化,学习统一的几何感知动作表示,实现跨物体、背景和机器人的泛化操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 89%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00321 2026-06-11 cs.RO 版本更新 89%

Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

具身可解释性:将因果理解与视觉-语言-动作模型的泛化联系起来

Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer, Shigang Yue, Hongbiao Dong, Zhou Daniel Hao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出干预显著性评分(ISS)和干扰质量比(NMR),通过干预掩码估计视觉区域对动作预测的因果影响,并量化对任务无关特征的归因,实验表明NMR可预测泛化行为,ISS比现有方法提供更忠实的解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06904 2026-06-11 cs.RO cs.CV 版本更新 85%

ActionMap: Robot Policy Learning via Voxel Action Heatmap

ActionMap: 基于体素动作热图的机器人策略学习

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) NVIDIA(英伟达)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出ActionMap,一种将动作空间建模为体素热图的动作解码器,替代现有VLA模型中的单点预测器,在LIBERO仿真和真实Franka操作中提升性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新 79%

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22670 2026-06-11 physics.comp-ph 版本更新 71%

A survey of interlayer interaction models for graphene and other 2D materials

石墨烯及其他二维材料层间相互作用模型综述

Gourav Yadav, Shakti S. Gupta, Roger A. Sauer

专题命中 VLA模型 :action model(title)

AI总结 综述了描述二维材料间范德华相互作用的力学模型,涵盖连续弹性体与离散晶体材料,重点讨论了法向和切向接触模型、外部载荷及尺度变化对基态构型和摩擦接触行为的影响,并分析了多尺度建模中降低计算成本的策略。

Comments 55 pages, 25 figures

Journal ref Adv. Mater. Interfaces (2026), e70553

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03429 2026-06-11 astro-ph.HE astro-ph.SR 版本更新 67%

Milliarcsecond-scale spectrum of the persistent radio source associated with FRB 20190417A and constraints for FRB 20181030A

与FRB 20190417A相关的持续射电源的VLBI谱

G. Bruni, L. Piro, Y. -P. Yang, L. Nicastro, A. Rossi, E. Palazzi, E. Maiorano, S. Savaglio, B. Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用EVN在5和8 GHz观测,确认FRB 20190417A的致密射电源具有非热性质和平坦谱(α=-0.19±0.29),支持星云起源,并限制FRB 20181030A的候选PRS具有陡谱。

Comments Accepted for publication in A&A Letters

Journal ref A&A 710, L31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23130 2026-06-11 cs.HC cs.CR 版本更新 50%

From Preventive to Reactive: How AI Coding Assistants Transform Developers' Security Awareness

从预防到反应:AI编程助手如何改变开发者的安全意识

Faisal Haque Bappy, Tahrim Hossain, Sidratul Muntaher Meheraj, Annoor Sharara Akhand, Tasfia Tabassum, Tarannum Shaila Zaman, Raiful Hasan, Tariqul Islam

专题命中 VLA模型 :action model(abstract)

AI总结 通过访谈和观察15名专业开发者,发现AI编程助手将安全思考从编码阶段转移到审查阶段,导致从预防性安全转向反应性安全,并揭示了安全意识与行为脱节的现象。

Comments This paper has been accepted at the 2026 Symposium on Usable Privacy and Security (SOUPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09702 2026-06-11 cond-mat.mes-hall cond-mat.str-el 版本更新 50%

Non-Abelian Fibonacci quantum Hall states in 4-layer rhombohedral stacked graphene

四层菱方堆叠石墨烯中的非阿贝尔斐波那契量子霍尔态

Abigail Timmel, Xiao-Gang Wen

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究在菱方堆叠四层石墨烯中实现非阿贝尔斐波那契分数量子霍尔态的条件,通过调控磁场和位移场,在特定参数范围内稳定该态,并拓展到五层和三层石墨烯中的其他拓扑态。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2605.12386 2026-06-11 cs.RO 版本更新 57%

SafeManip: A Property-Driven Benchmark for Temporal Safety Evaluation in Robotic Manipulation

SafeManip: 一种基于属性的基准,用于机器人操作中的时间安全评估

Chengyue Huang, Khang Vo Huynh, Sebastian Elbaum, Zsolt Kira, Lu Feng

机构 * Department of Machine Learning, Georgia Institute of Technology(佐治亚理工学院机器学习系) Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 SafeManip通过定义可重用的安全模板,评估机器人操作中的时间安全属性,涵盖碰撞安全、抓取稳定性等八类安全类别,验证了现有方法在安全评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏