arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-19 至 2026-08-19 共收录 22 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 19 篇

2605.25477 2026-08-19 cs.RO cs.AI 版本更新 91%

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调

Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01035 2026-08-19 cs.RO cs.AI cs.CV 版本更新 91%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17600 2026-08-19 cs.RO 新提交 91%

LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models

LIBERO-VIFO:评估视觉-语言-动作模型视觉线索跟随的能力与安全性的基准

Zhengyan Qian, Rui Yan, Alex Jinpeng Wang, Jinhui Tang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 研究人员提出LIBERO-VIFO基准,评估7种VLA模型的视觉线索跟随能力与安全性,发现当前VLA存在无语言指令时执行线索指示任务的未授权跟随风险,确立了以视觉为中心的安全新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09948 2026-08-19 cs.AI cs.CV cs.RO 版本更新 90%

LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

LoopVLA: 在视觉-语言-动作模型中学习充分性

Boyang Shen, Kaixiang Yang, Hao Wang, Qiuyu Yu, Qiang Xie, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 89%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 89%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-19 cs.RO 新提交 87%

EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-08-19 cs.CV cs.RO 版本更新 86%

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17484 2026-08-19 cs.RO 新提交 84%

Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies

检索前先复用:诊断具身多模态策略测试时增强的余量与互补性

Yuhwan Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出通过可恢复余量与检索互补性两个因素,为具身多模态冻结 VLA 策略的测试时增强选择采样或检索干预,在 LIBERO 上成功提升最高 21.0 个百分点,且可迁移至其他机器人与环境。

Comments Accepted to ECCV 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17209 2026-08-19 cs.RO cs.AI cs.CV cs.LG 新提交 84%

Teach and Grow: An Agent-Centered Architecture for General Robot Learning

教学与成长:面向通用机器人学习的智能体中心架构

Chang Nie, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出TGL智能体中心架构,通过将演示转化为可复用技能块,无需特定任务再训练即可实现通用机器人学习,在LIBERO评估中达SOTA性能,还提出相关缩放定律假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 81%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: this https URL (https://zzongzheng0918.github.io/TE-Aware-E2E-AD/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-19 cs.RO 版本更新 81%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Yao Li, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Jiajun Deng, Yanyong Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17951 2026-08-19 astro-ph.SR 新提交 80%

Observations of Disrupted CME Material Falling Back Into the Low Corona

回落至低日冕的受扰日冕物质抛射(CME)物质观测

Brian E. Wood, Jason E. Kooi

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究利用SOHO、STEREO-A、SDO和VLA的观测数据,通过运动学阻力模型,观测到受扰CME物质回落至低日冕的现象,发现其可能有助于日冕雨的形成。

Comments 28 pages, 15 figures, to appear in The Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17717 2026-08-19 cs.RO 新提交 77%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17163 2026-08-19 cs.LG cs.AI 新提交 73%

Q-Learning With World Models

结合世界模型的Q学习

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15449 2026-08-19 astro-ph.GA 版本更新 67%

The Steep-spectrum Radio-loud AGN Luminosity Function and Its Implications for Black Hole Growth and Star Formation

阶梯谱射电明亮活动星系核的发光函数及其对黑洞生长和恒星形成的启示

Wenjie Wang, Zunli Yuan, B. Šlaus, Hongwei Yu, Yu Luo

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究利用4555个阶梯谱射电明亮AGN样本,探讨其宇宙演化,提出LADE框架模型,揭示低功率和高功率源的统一演化模式,并显示AGN发光函数与恒星形成率的关联。

Comments 27 pages, 14 figures, Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18026 2026-08-19 cs.LG cs.CE 新提交 57%

TabNSM: Neural Sparse Mixer for Tabular Regression

TabNSM:面向表格回归的神经稀疏混合器

Ali Eslamian, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Institute for Biomedical Informatics(生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 该研究提出TabNSM框架,通过自适应稀疏交互模块、多阶段回归头等组件,在9个真实回归基准上实现高维表格回归的优性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16988 2026-08-19 astro-ph.EP 新提交 50%

Causes of Hot Jupiter Inflation from Causal Discovery

基于因果发现的热木星膨胀成因研究

Zehao Jin, Mohamad Ali-Dib, Yujia Zheng, Mario Pasquato, Benjamin L. Davis, Andrea V. Maccio

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过因果发现分析328颗短周期巨行星数据,发现热木星半径与轨道周期、恒星温度直接相关,提示Gold-Soter热潮汐等过程是其膨胀的重要成因,为热木星膨胀机制研究提供了新方法。

Comments Accepted for publication in The Astronomical Journal. Data & code hosted at GitHub repository: this https URL (https://github.com/ZehaoJin/Causal-Hot-Jupiter-Inflation)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 3 篇

2606.07464 2026-08-19 cs.RO cs.AI cs.CV 版本更新 67%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18077 2026-08-19 cs.RO 新提交 57%

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: this https URL (https://nvidia-isaac.github.io/video_to_data/hydra-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14000 2026-08-19 cs.RO 版本更新 57%

A Diffusion-Refined Planner with Reinforcement Learning Priors for Confined-Space Parking

用于狭窄空间泊车的带强化学习先验的扩散优化规划器

Mingyang Jiang, Yueyuan Li, Jiaru Zhang, Songan Zhang, Ming Yang

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出带强化学习先验的扩散优化规划器DRIP,用于解决狭窄空间泊车规划精度不足的问题,在提升狭窄空间泊车规划性能的同时保持常规场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏