arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-19 至 2026-08-19 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2608.17600 2026-08-19 cs.RO 新提交 91%

LIBERO-VIFO: Benchmarking the Capability and Safety of Visual Cue Following in Vision-Language-Action Models

LIBERO-VIFO:评估视觉-语言-动作模型视觉线索跟随的能力与安全性的基准

Zhengyan Qian, Rui Yan, Alex Jinpeng Wang, Jinhui Tang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 研究人员提出LIBERO-VIFO基准,评估7种VLA模型的视觉线索跟随能力与安全性,发现当前VLA存在无语言指令时执行线索指示任务的未授权跟随风险,确立了以视觉为中心的安全新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 89%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 89%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-19 cs.RO 新提交 87%

EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17484 2026-08-19 cs.RO 新提交 84%

Reuse Before You Retrieve: Diagnosing Headroom and Complementarity for Test-Time Augmentation of Embodied Multimodal Policies

检索前先复用:诊断具身多模态策略测试时增强的余量与互补性

Yuhwan Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出通过可恢复余量与检索互补性两个因素,为具身多模态冻结 VLA 策略的测试时增强选择采样或检索干预,在 LIBERO 上成功提升最高 21.0 个百分点,且可迁移至其他机器人与环境。

Comments Accepted to ECCV 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17209 2026-08-19 cs.RO cs.AI cs.CV cs.LG 新提交 84%

Teach and Grow: An Agent-Centered Architecture for General Robot Learning

教学与成长:面向通用机器人学习的智能体中心架构

Chang Nie, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究提出TGL智能体中心架构,通过将演示转化为可复用技能块,无需特定任务再训练即可实现通用机器人学习,在LIBERO评估中达SOTA性能,还提出相关缩放定律假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 81%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: this https URL (https://zzongzheng0918.github.io/TE-Aware-E2E-AD/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17951 2026-08-19 astro-ph.SR 新提交 80%

Observations of Disrupted CME Material Falling Back Into the Low Corona

回落至低日冕的受扰日冕物质抛射(CME)物质观测

Brian E. Wood, Jason E. Kooi

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究利用SOHO、STEREO-A、SDO和VLA的观测数据,通过运动学阻力模型,观测到受扰CME物质回落至低日冕的现象,发现其可能有助于日冕雨的形成。

Comments 28 pages, 15 figures, to appear in The Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17717 2026-08-19 cs.RO 新提交 77%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17163 2026-08-19 cs.LG cs.AI 新提交 73%

Q-Learning With World Models

结合世界模型的Q学习

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18026 2026-08-19 cs.LG cs.CE 新提交 57%

TabNSM: Neural Sparse Mixer for Tabular Regression

TabNSM:面向表格回归的神经稀疏混合器

Ali Eslamian, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Institute for Biomedical Informatics(生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 该研究提出TabNSM框架,通过自适应稀疏交互模块、多阶段回归头等组件,在9个真实回归基准上实现高维表格回归的优性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16988 2026-08-19 astro-ph.EP 新提交 50%

Causes of Hot Jupiter Inflation from Causal Discovery

基于因果发现的热木星膨胀成因研究

Zehao Jin, Mohamad Ali-Dib, Yujia Zheng, Mario Pasquato, Benjamin L. Davis, Andrea V. Maccio

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过因果发现分析328颗短周期巨行星数据,发现热木星半径与轨道周期、恒星温度直接相关,提示Gold-Soter热潮汐等过程是其膨胀的重要成因,为热木星膨胀机制研究提供了新方法。

Comments Accepted for publication in The Astronomical Journal. Data & code hosted at GitHub repository: this https URL (https://github.com/ZehaoJin/Causal-Hot-Jupiter-Inflation)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2608.18077 2026-08-19 cs.RO 新提交 57%

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: this https URL (https://nvidia-isaac.github.io/video_to_data/hydra-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏