arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-04 至 2026-05-04 共收录 12 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2405.14093 2026-05-04 cs.RO cs.CL cs.CV 91%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);language-conditioned robot(abstract)

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 90%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00078 2026-05-04 cs.RO cs.CV cs.LG 89%

Being-H0.7: A Latent World-Action Model from Egocentric Videos

Being-H0.7: 一种从第一人称视频中学习的潜在世界-动作模型

Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond团队)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Being-H0.7,通过在感知与动作之间插入可学习的潜在查询,实现未来感知的VLA策略,无需生成未来帧,提升预测效率与部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03500 2026-05-04 cs.RO 86%

VLAs are Confined yet Capable of Generalizing to Novel Instructions

视觉-语言-动作模型在受限的同时能够泛化到新指令

Quanyi Li

机构 * Independent(独立)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出通过操控VLA内部表示实现不同任务行为的重组,通过文本潜在表示插值提升泛化能力,实验表明其在新指令任务中表现优异,但存在空间过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26848 2026-05-04 cs.RO 77%

STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation

STARRY:面向机器人操作的时空动作中心世界建模

Yuxuan Tian, Yurun Jin, Bin Yu, Yukun Shi, Hao Wu, Chi Harold Liu, Kai Chen, Cong Huang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) DeepCybo

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00659 2026-05-04 astro-ph.GA 67%

The NIKA2 Cosmological Legacy Survey in COSMOS: Final 1.2mm and 2mm source catalogs and redshift distribution of dusty star-forming galaxies

NIKA2宇宙学遗产调查在COSMOS中的最终1.2毫米和2毫米源目录及尘埃星系的红移分布

C. R. Carvajal-Bohorquez, G. Lagache, A. Beelen, R. Adam, P. Ade, H. Ajeddig, S. Amarantidis, P. André, M. Aravena, H. Aussel, A. Benoît, S. Berta, M. Béthermin, L. -J. Bing, A. Bongiovanni, J. Bounmy, O. Bourrion, M. Calvo, Caitlin M. Casey, A. Catalano, D. Chérouvrier, U. Chowdhury, M. De Petris, F. -X. Désert, S. Doyle, E. F. C. Driessen, G. Ejlali, A. L. Faisst, A. Ferragamo, A. Gomez, J. Goupy, C. Hanser, Shuowen Jin, Jeyhan S. Kartaltepe, S. Katsioli, F. Kéruzoré, C. Kramer, B. Ladjelat, S. Leclercq, J. -F. Lestrade, J. F. Macías-Pérez, S. C. Madden, Felix Martinez, A. Maury, F. Mayet, A. Monfardini, A. Moyer-Anin, M. Muñoz-Echeverría, I. Myserlis, R. Neri, A. Paliwal, L. Perotto, G. Pisano, N. Ponthieu, V. Revéret, A. J. Rigby, A. Ritacco, H. Roussel, F. Ruppin, M. Sánchez-Portal, S. Savorgnano, K. Schuster, A. Sievers, S. Toft, C. Tucker, Jorge A. Zavala, R. Zylka

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文基于NIKA2宇宙学遗产调查在COSMOS区域的最终1.2毫米和2毫米源目录,研究高红移尘埃星系的物理性质和演化。

Comments Submitted to A&A on 30 April. Some of the data are already available at https://data.lam.fr/n2cls; the remainder will be made available upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18689 2026-05-04 astro-ph.CO 67%

Cosmic dipole tensions: confronting the cosmic microwave background with infrared and radio populations of cosmological sources

宇宙偶极子张力:用红外和无线电源群体对抗宇宙微波背景

Mali Land-Strykowski, Geraint F. Lewis, Tara Murphy

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究通过分析不同数据集间的偶极子张力,发现Planck与CatWISE存在显著矛盾,而RACS与两者存在系统差异,需约10^6个无线电源才能达到5σ显著性。

Comments 13 pages, 5 figures, accepted for publication in MNRAS; updated to include published correction, conclusions unchanged (3 pages, 3 figures)

Journal ref MNRAS, Volume 543, Issue 4, November 2025, Pages 3229-3241; Correction: MNRAS, Volume 548, Issue 3, May 2026, stag483

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00438 2026-05-04 cs.AI cs.RO 62%

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00241 2026-05-04 quant-ph 50%

Exploring the Geometric and Dynamical Properties of Spin Systems and Their Interplay with Quantum Entanglement

探索自旋系统的几何和动力学性质及其与量子纠缠的相互作用

Jamal Elfakir

专题命中 VLA模型 :action model(abstract)

AI总结 本文从几何和动力学角度探讨自旋系统的性质及其与量子纠缠的关系,分析了经典相空间、量子态的几何描述以及不同相互作用模型下的自旋系统动力学和几何结构。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2605.00475 2026-05-04 cs.RO cs.CV 62%

MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation

MSACT:多阶段空间对齐用于稳定低延迟精细操控

Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(武藏大学多媒体艺术与科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MSACT,通过多阶段空间对齐模块提升低延迟精细操控的稳定性,结合预训练ResNet视觉先验,增强视觉到动作的映射稳定性,实验证明在模拟和真实任务中提升了定位稳定性和任务性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2605.00397 2026-05-04 cs.RO 74%

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

MiniVLA-Nav v1:一种多场景模拟数据集用于语言条件的机器人导航

Ali Al-Bustami, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 数据集与评测 :language-conditioned robot(title);分类 cs.RO

AI总结 本文提出MiniVLA-Nav v1数据集,用于语言引导的物体接近导航任务,包含四个逼真环境,提供同步图像、深度图和分割掩码,支持多种评估分割。

Comments 9 pages, 12 figures, 7 tables. Dataset paper

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2605.00471 2026-05-04 cs.RO 57%

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

立体多阶段空间注意力用于在视觉尺度变化和干扰下的实时移动操作

Xianbo Cai, Hideyuki Ichiwara, Hyogo Hiruma, Masaki Yoshikawa, Hiroshi Ito, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(媒体艺术与科学系,早稻田大学) SB Intuitions Corp.(SB Intuitions公司) Research and Development Group, Hitachi, Ltd.(日立株式会社研发部) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出一种基于立体多阶段空间注意力的深度预测学习方法,用于实时移动操作,通过层次递归架构整合空间注意力点与机器人状态,提升在视觉尺度变化和干扰下的鲁棒性和任务成功率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏