arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-10 至 2026-06-10 共收录 18 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2510.14836 2026-06-10 cs.CV cs.RO 版本更新 94%

QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models

QDepth-VLA:量化深度预测作为视觉-语言-动作模型的辅助监督

Yixuan Li, Yuhui Chen, Mingcai Zhou, Haoran Li, Zhengtao Zhang, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongke Huiling Robot Technology Co.(北京中科创联机器人科技有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出QDepth-VLA框架,通过辅助深度预测任务增强VLA模型的空间感知与推理能力,在仿真和真实任务中提升操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10180 2026-06-10 cs.RO cs.AI cs.HC 新提交 91%

Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs

流控制:通过简单实时输入引导视觉-语言-动作模型

Jonathan C. Kao, Jason Chan, Andy Wang

机构 * Departments of Electrical and Computer Engineering, Computer Science, and Neurobiology, University of California, Los Angeles(电气与计算机工程系、计算机科学系和神经生物学系,加州大学洛杉矶分校) Department of Computer Science University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 提出流控制方法,利用键盘等通用实时输入引导VLA模型动作,无需重新训练,能提升任务成功率和完成速度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10267 2026-06-10 cs.RO cs.AI cs.LG 新提交 91%

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

机器人策略编排的关键因素:分层VLA智能体的系统研究

Jiaheng Hu, Mohit Shridhar, Caden Lu, Dhruv Shah, Hao-Tien Lewis Chiang, Jie Tan, Annie Xie

机构 * Google DeepMind(谷歌DeepMind)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10568 2026-06-10 cs.RO 新提交 91%

VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models

VeriSpace: 面向视觉-语言-动作模型的空间基础动作验证

Guiyu Zhao, Longteng Guo, Junyou Zhu, Jun Fu, Yanghong Mei, Bin Cao, Jie Jiang, Xingjian He, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出VeriSpace,一种3D感知的动作验证器,通过双路径3D注入场景编码和空间基础动作推理,在测试时选择候选动作,提升VLA模型的可靠性。

Comments Submit to ACM MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10501 2026-06-10 cs.RO 新提交 91%

Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults

揭示视觉-语言-动作模型在关节级物理故障下的脆弱性

Minsoo Jo, Taeju Kwon, Junha Chun, Youngjoon Jeong, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本研究揭示VLA模型在机器人关节级物理故障(如执行器退化、摩擦增加)下性能显著下降,并提出轻量级残差校准框架J-PARC,通过推断关节故障状态并自适应修正动作,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新 91%

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10366 2026-06-10 cs.RO cs.AI 新提交 91%

A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation

提升VLA评估中仿真与真实相关性的实用指南

Shuo Wang, Hanyuan Xu, Yingdong Hu, Fanqi Lin, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文系统研究仿真与真实环境在VLA策略评估中的相关性,提出统一框架来测量和提升仿真作为真实评估代理的有效性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10305 2026-06-10 cs.RO 新提交 84%

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作

Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17993 2026-06-10 astro-ph.GA astro-ph.HE 71%

Nuclear Activity and Host Galaxy Properties of Low-Luminosity AGN Identified from VLA Observations

低亮度活动星系核的核活动与宿主星系性质:基于VLBA观测的结果

M. N. Rosli, A. Annuar

专题命中 VLA模型 :VLA(title)

AI总结 本文研究了通过VLBA观测识别出的低亮度活动星系核(LLAGN)的核活动与宿主星系性质,发现这些LLAGN具有较低的反照率、较小的黑洞质量和较低的吸积率,且宿主星系的恒星质量较低,恒星形成率受抑制。

Comments 20 pages, 7 figures

Journal ref Mon Not R Astron Soc (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01425 2026-06-10 astro-ph.GA 67%

HI asymmetries of galaxies in the Ursa Major and Perseus-Pisces environments

室女座和仙女座-室女座环境中的星系HI不对称性

P. V. Bilimogga, E. Busekool, M. A. W. Verheijen, J. M. van der Hulst

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究室女座和仙女座-室女座环境中的星系HI不对称性,发现PP环境中更多星系具有不对称HI轮廓,且形态不对称性更高,揭示环境对星系演化的影响力。

Journal ref A&A 710, A159 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 57%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10215 2026-06-10 physics.space-ph physics.plasm-ph 新提交 50%

LEAP: A Rapid Neural Surrogate of Multi-Fluid MHD at Europa

LEAP: 欧罗巴多流体磁流体动力学的快速神经替代模型

Sachin Alexander Reddy, Abigail R. Azari, Corey J. Cochrane, Xianzhe Jia, Tom A. Nordheim, Lukas Mandrake, Steven D. Vance, Camilla Harris, Ioana Ciucǎ

专题命中 VLA模型 :action model(abstract)

AI总结 针对欧罗巴地下海洋探测中MHD模型计算成本高的问题,提出基于Transformer的替代模型LEAP,实现毫秒级预测磁场扰动,速度提升约40000倍,精度与MHD相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10858 2026-06-10 cond-mat.stat-mech cond-mat.soft 新提交 50%

Thermodynamic Approach to Momentum Transport in Dense Fluids

稠密流体中动量输运的热力学方法

Christopher Devik Fjeldstad, Jonas Bueie, Astrid S. de Wijn

专题命中 VLA模型 :action model(abstract)

AI总结 提出一种基于交换函数的热力学框架,将Chapman-Enskog理论扩展到非硬球流体,预测剪切粘度,在Lennard-Jones流体上误差低于8.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 75%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20935 2026-06-10 math.OC 版本更新 50%

Periodic solutions of nonlinear control systems with switching: a Lie-algebraic and contraction approach

具有切换的非线性控制系统的周期解:一种李代数和收缩方法

Alexander Zuyev, Peter Benner

专题命中 动作表示与策略 :action model(abstract)

AI总结 本文通过李代数和收缩方法,将非线性控制仿射系统在bang-bang控制下的周期解问题转化为寻找指数映射复合的不动点,并利用BCHD公式和增量稳定性简化问题,最终应用于化学反应的性能优化。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Control Systems Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2602.23499 2026-06-10 cs.RO cs.AI 版本更新 62%

TaCarla: A comprehensive benchmarking dataset for end-to-end autonomous driving

TaCarla: 端到端自动驾驶的综合基准数据集

Tugrul Gorgulu, Atakan Dag, M. Esat Kalfaoglu, Halil Ibrahim Kuru, Baris Can Cam, Halil Ibrahim Ozturk, Ozsel Kilinc

机构 * Tuğrul Gorgülü *†(土耳其巴伊塞蒂大学) Atakan Dağ †(土耳其巴伊塞蒂大学) M. Esat Kalfaoğlu ‡(土耳其巴伊塞蒂大学) Halil İbrahim Kuru †(土耳其巴伊塞蒂大学) Barış Can Cam †(土耳其巴伊塞蒂大学) Halil İbrahim Öztürk †(土耳其巴伊塞蒂大学) Özsel Kılınç §(土耳其巴伊塞蒂大学)

专题命中 数据集与评测 :action model(abstract);分类 cs.RO、cs.AI

AI总结 针对现有自动驾驶数据集不完整、行为多样性不足及闭环评估缺失等问题,基于CARLA Leaderboard 2.0挑战场景收集超过285万帧的多任务数据集,支持规划、检测、预测及视觉语言动作模型,并提供数值稀有度评分。

Comments Accepted at the Third Workshop on Simulation for Autonomous Driving (SAD), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 2 篇

2606.10363 2026-06-10 cs.RO 新提交 79%

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

机构 * The University of Hong Kong(香港大学) INFIFORCE Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Southern University of Science and Technology(南方科技大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO

AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05291 2026-06-10 cs.RO 版本更新 70%

Online Self-Training for Co-Adaptation in Hierarchical Diffusion Policies

层次扩散策略中的在线自训练协同适应

Clemence Grislain, Mathilde Kappel, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出ORCHID自训练框架,通过环境反馈过滤轨迹并蒸馏回规划器和控制器,实现层次扩散策略的在线稳定改进,在CALVIN基准上轻量模型超越纯离线方法。

Comments Accepted at ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation (DEMO)

详情

展开后加载摘要…

URL PDF HTML 收藏