arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-18 至 2026-06-18 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 6 篇

2606.19297 2026-06-18 cs.LG cs.RO 新提交 94%

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

VLA 甚至知道基础知识吗?衡量视觉-语言-动作模型中的常识和世界知识保留

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

机构 * CogAI Lab(CogAI实验室) FusionBrain Lab(FusionBrain实验室) IAI MSU(MSU人工智能研究所) Lomonosov MSU(Lomonosov莫斯科大学) NUST MISIS Applied AI Institute(应用人工智能研究所) HSE University(俄罗斯高等经济大学) Generalizable AI Systems(可泛化人工智能系统) ISP RAS(俄罗斯科学院信息与自动化过程研究所) MIRAI Domain-specific NLP Group(领域特定自然语言处理小组)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 提出 Act2Answer 协议,通过动作回答评估 VLA 模型的知识保留,发现模型在简单概念上表现良好,但在丰富语义类别上存在差距,且 VQA 联合训练有助于知识保留。

Comments Project page: https://tttonyalpha.github.io/act2answer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18953 2026-06-18 cs.RO 新提交 91%

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

面向零样本仿真到现实VLA增强的以对象为中心的残差强化学习

Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita

机构 * KAIST(韩国科学技术院) Microsoft Research Asia - Tokyo(微软亚洲研究院-东京) The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出以对象为中心的残差强化学习框架,在仿真中训练策略,零样本迁移到真实机器人,将VLA模型成功率从42%提升至76%。

Comments 8 pages, 7 figures, 2 tables; 8-page appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19194 2026-06-18 cs.RO 新提交 77%

Invertible Neural Network Adapter for One-Step Flow Matching in Robot Manipulation

用于机器人操作中一步流匹配的可逆神经网络适配器

Yu Zhang, Kangyi Ji, Yongxiang Zou, Rongtao Xu, Feng Zheng, Long Cheng

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出可逆神经网络适配器,通过一步去噪过程生成高维动作,降低推理复杂度并保持精度,在仿真和真实实验中提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18589 2026-06-18 cs.RO 新提交 77%

DREAM-Chunk: Reactive Action Chunking with Latent World Model

DREAM-Chunk:基于潜在世界模型的反应式动作分块

Wenxi Chen, Kaidi Zhang, Chi Lin, Zhiyuan Zhang, Yu She, Yuejiang Liu, Raymond A. Yeh, Shaoshuai Mou, Yan Gu

机构 * Purdue University(普渡大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出DREAM-Chunk方法,通过轻量级潜在世界模型在测试时采样多个候选动作分块并选择最优执行,提升动作分块策略在随机动态下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09814 2026-06-18 astro-ph.SR astro-ph.GA 新提交 67%

ALMA measurements of mass loss and wind clumping in the massive stars of the Arches cluster

ALMA对Arches星团中大质量恒星的质量损失和风团块结构的测量

James P. Perry, Raman K. Prinja, Danielle M. Fenech, Francisco Najarro

专题命中 VLA模型 :VLA(summary_cn)

AI总结 利用ALMA和VLA数据,测量Arches星团中23颗大质量恒星的电离风质量损失率和团块结构,发现Wolf-Rayet星以热自由-自由辐射为主,而O型星存在非热同步辐射,并揭示风团块随半径减小。

Comments 16 pages, 5 figures, 7 tables, 2 appendices. Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17510 2026-06-18 cs.SE cs.SY eess.SY 新提交 50%

OmniDroneX: An LLM-Assisted Holistic Drone-as-a-Service Ecosystem

OmniDroneX: 一种LLM辅助的全方位无人机即服务生态系统

I-Ling Yen, Akeem Mohammed, Farokh Bastani, San-Yih Hwang

专题命中 VLA模型 :action model(abstract)

AI总结 提出OmniDroneX统一无人机即服务生态系统,通过libUAV接口和PT-SOA抽象模型连接底层物理与高层任务,利用大语言模型辅助功能识别、服务组合和自然语言任务定义,支持多种组合技术以实现可扩展、自演进的无人机系统。

Comments This manuscript is a full version of a paper accepted in shortened form by IEEE International Conference on Joint Cloud Computing

详情

展开后加载摘要…

URL PDF HTML 收藏