arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-15 至 2026-06-15 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2606.14010 2026-06-15 cs.CV cs.LG cs.RO 新提交 94%

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13856 2026-06-15 cs.RO 新提交 92%

Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning

输出级正则化消除单GPU VLA微调中的种子彩票

Jeffrin Sam, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯科尔科沃科学技术研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 发现单GPU微调VLA-JEPA时存在种子彩票现象(随机种子导致性能骤降29%),归因于输出坍塌,提出输出级正则化(VICReg、Dropout、减半学习率)可完全消除该问题。

Comments 10 pages, 8 figures, submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08881 2026-06-15 cs.RO cs.AI 新提交 91%

Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis

在SO-101上对视觉-语言-动作模型进行基准测试:失败与恢复分析

Yi Yu, Xinchuan Qiu

机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 提出SO-101低成本机器人平台基准,通过失败分类和恢复评估指标,系统比较VLA和模仿学习策略,发现执行不稳定是主要失败源。

Comments 13 pages, 9 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13886 2026-06-15 cs.RO cs.CV cs.LG 新提交 91%

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

PhysVLA:面向物理基础的VLA用于具身机器人操作

Namai Chandra, Shriram Damodaran, Lin Wang

机构 * IIT Madras(印度理工学院马德拉斯分校) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出PhysVLA,一种即插即用的推理时框架,通过相位有限状态机和选择性欧拉-拉格朗日门,在不重新训练的情况下为任何冻结的VLA骨干注入物理约束,提升成功率、稳定性和轨迹效率。

Comments 9 pages, 5 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14375 2026-06-15 cs.RO cs.AI 新提交 91%

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models

弹性查询强化学习:VLA模型的自我感知策略执行

Ge Wang, Xinyu Tan, Xiang Li, Man Luo, Chengsi Yao, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xiangyuan Wang, Zhixin Mai, Yiming Zhao, Yatong Han, Zhen Li

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出弹性查询强化学习(EQRL),通过轻量级潜在调度适配器动态调整VLA模型的推理步骤和动作块长度,利用评论家集成分歧估计状态难度,在降低推理成本的同时保持或提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14153 2026-06-15 cs.CV cs.RO 新提交 91%

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法

Qingping Zeng, Fei She

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18464 2026-06-15 cs.LG 版本更新 89%

AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models

AcceRL: 面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架

Chengxuan Lu, Shukuan Wang, Yanjie Li, Yingying Fang, Huoyan Wang, Tian Zhang, Wei Liu, Shiji Jin, Fuyuan Qian, Peiming Li, Chao Xu, Baigui Sun, Yang Liu

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(伊罗科技沃尔夫1069b实验室,三一集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.LG

AI总结 提出AcceRL框架,通过物理隔离环境交互、模型推理和梯度更新实现分布式异步强化学习,消除同步系统的空闲气泡,提升硬件利用率,并支持即插即用的世界模型集成,在LIBERO任务上实现2.4倍吞吐加速和200倍样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14084 2026-06-15 cs.RO 新提交 89%

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

自我改进的VLA策略:用于抗伪影动作平滑的选择性扩散噪声

Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics KAIST(韩国科学技术院) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) National University of Singapore(新加坡国立大学) DFKI(德国人工智能研究中心) University of Oldenburg(奥尔登堡大学) Monash University(莫纳什大学) University of Arkansas(阿肯色大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出一种无需训练的选择性扩散噪声方法,通过动态采样噪声向量增强视觉-语言-动作策略的鲁棒性和动作平滑性,在仿真和真实场景中成功率分别提升8%和10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交 79%

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 77%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05461 2026-06-15 cs.AI 版本更新 70%

Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

先输出类型,后质量:基于标准的自动驾驶安全XAI可接受性评估标准

Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj, Maria Spence

机构 * NVIDIA Corporation(英伟达公司) NVIDIA GmbH(英伟达德国分公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI

AI总结 针对基于ML的自动驾驶安全标准与XAI方法输出类型不匹配的证据类型缺口,从多个安全标准推导出19项可测试证据标准,评估六类XAI方法,发现因果XAI在三个生命周期阶段结构上必需,并提出了结构可接受性概念。

Comments Accepted at SAFECOMP 2026 Workshops (SASSUR); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14306 2026-06-15 cs.HC cs.AI 新提交 57%

Thinking Outside the [Chat]Box: Bridging Computer Science and Industrial Design for Cognitive-Inclusive Generative AI

跳出聊天框:融合计算机科学与工业设计的认知包容性生成式人工智能

Virginia Francisco, Daniel Guasch, Raquel Hervás

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对当前GenAI界面认知门槛高、对智力障碍者不友好等问题,通过跨学科设计挑战,提出融合计算机科学的结构化支架与工业设计的体验式支架的双层框架,以扩展认知包容性交互设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14015 2026-06-15 hep-ex 新提交 50%

Constraining Neutrino Interaction Uncertainties for Neutrino Oscillation Measurements at the T2K Experiment

T2K实验中微子振荡测量的中微子相互作用不确定性约束

K. Abe, S. Abe, H. Adhikary, R. Akutsu, H. Alarakia-Charles, Y. I. Alj Hakim, S. Alonso Monsalve, L. Anthony, S. Aoki, K. A. Apte, T. Arai, T. Arihara, S. Arimoto, Y. Asami, Y. Asaoka, Y. Ashida, E. T. Atkin, N. Babu, V. Baranov, G. J. Barker, G. Barr, D. Barrow, P. Bates, L. Bathe-Peters, M. Batkiewicz-Kwasniak, N. Baudis, A. Beliakova, V. Berardi, L. Berns, S. Bhattacharjee, A. Blanchet, A. Blondel, L. Bøe, P. M. M. Boistier, S. Bolognesi, B. Bombin, S. Bordoni, S. B. Boyd, C. Bronner, A. Bubak, M. Buizza Avanzini, J. A. Caballero, F. Cadoux, N. F. Calabria, D. Calvet, S. Cao, D. Carabadjac, S. L. Cartwright, M. P. Casado, M. G. Catanesi, J. Chakrani, A. Chalumeau, D. Cherdack, A. Chvirova, J. Coleman, G. Collazuol, F. Cormier, A. A. L. Craplet, A. Cudd, D. D'Ago, C. Dalmazzone, T. Daret, P. Dasgupta, C. Davis, Yu. I. Davydov, P. de Perio, G. De Rosa, T. Dealtry, C. Densham, A. Dergacheva, R. Dharmapal Banerjee, F. Di Lodovico, G. Diaz Lopez, S. Dolan, D. Douqa, T. A. Doyle, O. Drapier, K. E. Duffy, J. Dumarchez, P. Dunne, K. Dygnarowicz, A. Eguchi, M. El Baz, J. Elias, S. Emery-Schrenk, G. Erofeev, A. Ershova, G. Eurin, M. Fani, D. Fedorova, S. Fedotov, M. Feltre, L. Feng, D. Ferlewicz, A. J. Finch, M. D. Fitton, C. Forza, M. Friend, Y. Fujii, Y. Fukuda, N. Funayama, Y. Furui, A. N. Gaciño Olmedo, J. García-Marcos, A. C. Germer, L. Giannessi, C. Giganti, M. Girgus, V. Glagolev, M. Gonin, R. Gonzalez Jimenez, J. González Rosa, E. A. G. Goodman, K. Gorshanov, P. Govindaraj, M. Grassi, M. Guigue, F. Y. Guo, D. R. Hadley, S. Han, D. A. Harris, R. J. Harris, M. Hartz, T. Hasegawa, C. M. Hasnip, S. Hassani, N. C. Hastings, K. Hayashi, Y. Hayato, I. Heitkamp, D. Henaff, Y. Hino, K. Hiraide, J. Holeczek, A. Holin, T. Holvey, N. T. Hong Van, T. Honjo, M. C. F. Hooft, K. Hosokawa, R. Huang, J. Hu, A. K. Ichikawa, K. Ieki, M. Ikeda, T. H. Ishida, T. Ishida, M. Ishitsuka, H. Ito, S. Ito, A. Izmaylov, N. Jachowicz, B. Jargowsky, S. J. Jenkins, C. Jesús-Valls, M. Jia, J. J. Jiang, J. Y. Ji, T. P. Jones, P. Jonsson, S. Joshi, C. K. Jung, M. Kabirnezhad, A. C. Kaboth, K. Kadota, H. Kakuno, A. Kamata, J. Kameda, S. Karpova, V. S. Kasturi, Y. Kataoka, T. Katori, A. Kawabata, R. Kawabe, Y. Kawamura, M. Kawaue, E. Kearns, M. Khabibullin, N. V. Khomutov, A. Khotjantsev, T. Kikawa, S. King, V. Kiseeva, J. Kisiel, A. Klustová, L. Kneale, H. Kobayashi, S. R. Kobayashi, T. Kobayashi, L. Koch, S. Kodama, M. Kolupanova, A. Konaka, L. L. Kormos, Y. Koshio, K. Kowalik, R. Kralik, Y. Kudenko, Y. Kudo, A. Kumar Jha, R. Kurjata, V. Kurochka, T. Kutter, L. Labarga, M. Lachat, K. Lachner, J. Lagoda, S. M. Lakshmi, M. Lamers James, A. Langella, D. H. Langridge, J. -F. Laporte, D. Last, N. Latham, M. Laveder, L. Lavitola, M. Lawe, A. Leclerc, N. Lemaire, D. Leon Silverio, T. Leplumey, S. Levorato, S. V. Lewis, B. Li, C. Lin, R. P. Litchfield, S. L. Liu, W. Li, A. Longhin, A. Lopez Moreno, L. Ludovici, X. Lu, T. Lux, L. N. Machado, L. Magaletti, K. Mahn, K. K. Mahtani, M. Mandal, S. Manly, A. D. Marino, D. G. R. Martin, D. A. Martinez Caicedo, L. Martinez, M. Martini, N. Mashin, T. Matsubara, R. Matsumoto, V. Matveev, C. Mauger, K. Mavrokoridis, N. McCauley, K. S. McFarland, C. McGrew, J. McKean, A. Mefodiev, G. D. Megias, L. Mellet, C. Metelko, M. Mezzetto, S. Miki, V. Mikola, E. W. Miller, A. Minamino, O. Mineev, S. Mine, J. Mirabito, M. Miura, S. Moriyama, S. Moriyama, P. Morrison, Th. A. Mueller, D. Munford, A. Muñoz, L. Munteanu, Y. Nagai, T. Nakadaira, K. Nakagiri, M. Nakahata, Y. Nakajima, K. D. Nakamura, A. Nakano, Y. Nakano, S. Nakayama, T. Nakaya, K. Nakayoshi, C. E. R. Naseby, D. T. Nguyen, V. Q. Nguyen, K. Niewczas, S. Nishimori, Y. Nishimura, Y. Noguchi, T. Nosek, F. Nova, J. C. Nugent, H. M. O'Keeffe, L. O'Sullivan, R. Okazaki, W. Okinaga, K. Okumura, T. Okusawa, N. Onda, N. Ospina, L. Osu, N. Otani, Y. Oyama, V. Paolone, J. Pasternak, D. Payne, T. P. D. Peacock, M. Pfaff, L. Pickering, J. -B. Plançon, P. Podlaski, B. Popov, A. J. Portocarrero Yrey, M. Posiadala-Zezula, Y. S. Prabhu, H. Prasad, F. Pupilli, B. Quilain, P. T. Quyen, E. Radicioni, B. Radics, M. A. Ramirez Delgado, R. Ramsden, P. N. Ratoff, M. Reh, G. Reina, L. Restrepo, C. Riccio, D. W. Riley, E. Rondio, D. Ross, S. Roth, N. Roy, A. Rubbia, L. Russo, A. Rychter, W. Saenz, K. Sakashita, S. Samani, F. Sánchez, E. M. Sandford, Y. Sato, T. Schefke, C. M. Schloesser, K. Scholberg, M. Scott, Y. Seiya, T. Sekiguchi, H. Sekiya, M. Sekiyama, T. Sekiya, D. Seppala, D. Sgalaberna, A. Shaikhiev, M. Shiozawa, Y. Shiraishi, N. Shvarev, A. Shvartsman, V. Siccardi, N. Skrobova, K. Skwarczynski, D. Smyczek, M. Smy, J. T. Sobczyk, H. Sobel, F. J. P. Soler, A. J. Speers, R. Spina, A. Srivastava, P. Stowell, Y. Stroke, I. A. Suslov, A. Suzuki, M. Suzuki, S. Y. Suzuki, M. Tada, S. Tairafune, A. Takeda, Y. Takeuchi, K. Takeya, H. K. Tanaka, H. Tanigawa, A. Teklu, V. V. Tereshchenko, N. Thamm, C. Touramanis, N. Tran, T. Tsukamoto, M. Tzanov, Y. Uchida, M. Vagins, M. Varghese, I. Vasilyev, G. Vasseur, E. Villa, U. Virginet, T. Vladisavljevic, T. Wachala, S. -i. Wada, D. Wakabayashi, H. T. Wallace, J. G. Walsh, L. Wan, D. Wark, M. O. Wascko, A. Weber, R. Wendell, M. J. Wilking, C. Wilkinson, J. R. Wilson, C. Winterstein, K. Wood, C. Wret, J. Xia, Z. Xie, K. Yamamoto, T. Yamamoto, T. Yamazumi, C. Yanagisawa, Y. Yang, T. Yano, N. Yershov, U. Yevarouskaya, M. Yokoyama, Y. Yoshimoto, N. Yoshimura, R. Zaki, A. Zalewska, J. Zalipska, G. Zarnecki, J. Zhang, X. Y. Zhao, H. Zheng, H. Zhong, T. Zhu, M. Ziembicki, E. D. Zimmerman, M. Zito, S. Zsoldos

专题命中 VLA模型 :action model(abstract)

AI总结 本文详述T2K实验利用ND280近探测器约束中微子通量和相互作用截面,通过新模型和事件选择降低振荡参数拟合的系统误差,并验证方法稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏