arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-14 至 2026-08-14 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2604.05498 2026-08-14 cs.RO 版本更新 87%

JailWAM: Jailbreaking World Action Models in Robot Control

JailWAM: 在机器人控制中对World Action Models进行劫持

Hanqing Liu, Songping Wang, Jiahuan Long, Jiacheng Hou, Jialiang Sun, Chao Li, Yang Yang, Wei Peng, Xu Liu, Tingsong Jiang, Yao Mu, Wen Yao

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部重点实验室) PR Lab, Nanjing University(南京大学PR实验室) Defense Innovation Institute, Chinese Academy of Military Science(军事科学院国防创新研究院)

专题命中 VLA模型 :action model(title,title_cn);分类 cs.RO

AI总结 本文提出JailWAM框架,通过三级安全分类体系和三个核心组件,系统评估WAM的安全性,实验表明其能有效暴露物理漏洞,攻击成功率高达84.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-08-14 cs.RO cs.CV 版本更新 84%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11521 2026-08-14 cs.RO cs.AI 版本更新 81%

Keep the Future, Drop the Rollout: RIFT for World Action Models

保留未来,放弃展开:面向世界动作模型的RIFT

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-14 cs.RO 版本更新 79%

JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03781 2026-08-14 cs.RO 版本更新 70%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新 67%

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05246 2026-08-14 astro-ph.HE astro-ph.GA hep-ph 版本更新 50%

The emergence of X-ray emission lines during relativistic radio-jet formation in the changing-look active galactic nucleus 1ES 1927+654

在可变视类活动星系核1ES 1927+654相对论性射电喷流形成期间X射线发射线的出现

Dev R. Sadaula, Sibasish Laha, Eileen T. Meyer, Onic I. Shuvo, Main Pal, Ritesh Ghosh, Matteo Guainazzi, Fabio Pacucci, Stefano Bianchi, Luigi Gallo, Rostom Mbarek, Amelia M. Hankla, Fabio La Franca, Tahir Yaqoob, Megan Masterson, Erin Kara, Missagh Mehdipour, Claudio Ricci, Javier A Garcia, Timothy R. Kallman, Ralf Ballhausen, Mitchell C. Begelman, Alexander Philippov, Suvendu Rakshit, Francesca Panessa, Ehud Behar, S. Bradley Cenko, Federica Ricci, Ilaria Villani, James N. Reeves

专题命中 VLA模型 :VLA(abstract)

AI总结 对1ES 1927+654进行多波段监测,用多台设备观测其光谱演化。发现喷流形成时出现软X射线发射线,还检测到Fe K发射特征,揭示电离吸收体变化及吸积和外流过程转变,表明喷流形成时相关区域稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2511.07820 2026-08-14 cs.RO cs.AI cs.CV cs.GR cs.SY eess.SY 版本更新 80%

SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

SONIC:为自然人形全身体控进行超大规模运动追踪

Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, Sirui Chen, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Jinhyung Park, David Sami, Zi Wang, Xingye Da, Runyu Ding, Cyrus Hogg, Lina Song, Edy Lim, Eugene Jeong, Tairan He, Haoru Xue, Wenli Xiao, Simon Yuen, Jan Kautz, Yan Chang, Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种超大规模运动追踪方法,通过扩大模型容量、数据和计算资源,实现了一种能够产生自然且稳健全身体态的通用人形控制器,并展示了其在运动追踪任务中的可扩展性及在下游任务中的应用价值。

Comments Project page: https://nvlabs.github.io/SONIC/

Journal ref Science Robotics 11 (117), eaed4592 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新 73%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 动作表示与策略 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏