arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-27 至 2026-04-27 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2512.22519 2026-04-27 cs.RO 91%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22591 2026-04-27 cs.RO 91%

RedVLA: Physical Red Teaming for Vision-Language-Action Models

RedVLA:面向视觉-语言-动作模型的物理红队测试

Yuhao Zhang, Borong Zhang, Jiaming Fan, Jiachen Shen, Yishuai Cai, Yaodong Yang, Jiaming Ji

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 RedVLA通过两阶段流程系统揭示VLA模型中的不安全行为,通过风险场景合成和风险放大技术,在10次优化迭代内达到95.5%的检测准确率,提出轻量级安全防护方案SimpleVLA-Guard。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 90%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10698 2026-04-27 cs.CV cs.AI 90%

AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models

AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型

Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Information Technology, Carleton University(卡尔顿大学信息技术学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出AugVLA-3D框架,通过整合深度估计提升视觉-语言-动作模型的3D特征表示,增强模型在复杂3D环境中的感知与动作预测能力。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20834 2026-04-27 cs.RO 89%

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO 87%

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20831 2026-04-27 cs.AI cs.LG 62%

Context-Sensitive Abstractions for Reinforcement Learning with Parameterized Actions

具有参数化动作的强化学习中的上下文敏感抽象

Rashmeet Kaur Nayyar, Naman Shah, Siddharth Srivastava

机构 * AAIR-lab(AAIR实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种能够在线自主学习状态和动作抽象的方法,以提升长周期稀疏奖励环境下参数化动作的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21943 2026-04-27 physics.space-ph 50%

Multi-Fidelity Monte-Carlo Estimation of Satellite Drag in Very-Low-Earth Orbit

多保真度蒙特卡洛估计近地轨道卫星阻力

Jovan Boskovic, Marcel Pfeifer, Andrea Beck

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种多保真度蒙特卡洛方法,利用DSMC求解器和两种低保真度面板方法估算近地轨道卫星阻力系数的均值和高阶矩,以降低高保真度求解器的计算成本。

Comments 20 pages, 8 figures. Submitted to Acta Astronautica

详情

展开后加载摘要…

URL PDF HTML 收藏