arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-08 至 2026-05-08 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2511.14148 2026-05-08 cs.RO cs.AI cs.LG 90%

AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models

AsyncVLA: 视觉-语言-动作模型中的异步流匹配

Yuhua Jiang, Shuang Cheng, Yan Ding, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Lumos Robotics(Lumos机器人)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出AsyncVLA,一种引入异步流匹配的视觉-语言-动作模型框架,通过非均匀时间调度和自修正机制提升长周期任务的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06481 2026-05-08 cs.RO 87%

OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation

OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型

Yushan Liu, Peibo Sun, Shoujie Li, Yifan Xie, Lingfeng Zhang, Xintao Chao, Shiyuan Dong, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05412 2026-05-08 astro-ph.GA astro-ph.SR 80%

A Dual-Band Centimetre Continuum Monitoring Survey of Young Stellar Objects in the Coronet Cluster

双频厘米波连续监测巡天:Coronet星团中的年轻恒星对象

Johanan Ramírez-Arellano, Carlos Carrasco-González, Roberto Galván-Madrid, Hauyu Baobab Liu, Jan Forbrich, Arpan Ghosh, Yenifer Angarita, Carlos G Román-Zuñiga

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 利用VLA在9.0GHz和14.0GHz对Coronet星团进行双频厘米波连续监测,发现20个射电源,包括14个已知年轻恒星对象,揭示了不同演化阶段YSOs的射电特性及变异性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06247 2026-05-08 cs.RO 79%

CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models

CKT-WAM: 在世界动作模型之间高效传递上下文知识

Yuhua Jiang, Yijun Guo, Hongbing Yang, Guojun Lei, Nuo Chen, Yinuo Zhang, Shaoqiang Yan, Bo Lin, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) LivsynRobotics Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 79%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28192 2026-05-08 cs.RO cs.CV 79%

LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning

LaST-R1:通过自适应物理潜在推理强化机器人操作

Hao Chen, Jiaming Liu, Zhonghao Yan, Nuowei Han, Renrui Zhang, Chenyang Gu, Jialin Gao, Ziyu Guo, Siyuan Qian, Yinxi Wang, Peng Jia, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院) Simplexity Robotics Project(Simplexity机器人项目)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LaST-R1,一种基于强化学习的后训练框架,通过联合优化潜在推理过程和动作生成,提升机器人在动态环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05714 2026-05-08 cs.CV cs.RO 79%

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

TriRelVLA:三元关系结构用于可迁移的具身操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 TriRelVLA通过构建三元关系结构,解决视觉语言动作模型在未见场景和物体上的泛化问题,提升具身操作的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 78%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 73%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06219 2026-05-08 cs.AI 57%

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

联合一致性:通过能量最小化实现的统一测试时间聚合框架

Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

机构 * EPFL(苏黎世联邦理工学院) SUFE(上海财经大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出联合一致性框架,通过能量最小化统一测试时间聚合,整合现有投票和加权聚合方法,利用LLM作为裁判进行交互矩阵构建,并在大规模测试中实现高效近似策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06619 2026-05-08 cs.CL cs.CY 50%

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

算法语言:隐藏在开放中的平衡:可理解性与检测规避之间的权衡

Jan Fillies, Ronald E. Robertson, Jeffrey Hancock

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学)

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了算法语言在内容生成和审核中的平衡问题,提出了多数可理解调制概念,并通过实验验证了可理解性与检测规避之间的关系。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02979 2026-05-08 hep-ph nucl-th 50%

Scattering and Femtoscopic Correlation Functions of the $Σ_c^{++}π^{+}$, $Σ_c^{0}π^{-}$ and $Σ_b^{+}π^{+}$ Systems

$Σ_c^{++}π^{+}$、$Σ_c^{0}π^{-}$和$Σ_b^{+}π^{+}$系统的散射与费米科斯相关函数

Mikel F. Barbat, Juan Nieves, Laura Tolos

专题命中 VLA模型 :action model(abstract)

AI总结 本文研究了$Σ_c^{++}π^{+}$、$Σ_c^{0}π^{-}$和$Σ_b^{+}π^{+}$系统的散射和费米科斯相关函数,探讨了强相互作用和静电效应对结果的影响,发现静电效应会降低对强相互作用细节的敏感性。

Comments 13 pages, 9 figures, 1 table, discussion extended including the $Σ_c^{0}π^{-}$ channel, accepted version for publication in Physics Letters B

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01070 2026-05-08 gr-qc hep-th 50%

Barrow holographic dark energy interacting model in the presence of radiation and matter

带有辐射和物质的Barrow隐暗能量相互作用模型

Gopinath Guin, Souvik Paul, Sunandan Gangopadhyay

专题命中 VLA模型 :action model(abstract)

AI总结 研究了非平坦宇宙中动态辐射对Barrow隐暗能量模型的影响,通过四种不同相互作用模型分析了暗能量、暗物质和辐射的能量密度参数演化,发现Barrow指数越高,暗能量方程状态参数越早进入虚粒子区域,并通过观测数据约束了宇宙学参数,表明可能解决哈勃张力问题。

Comments 50 pages, 40 figures, Updated version, comments are welcome

Journal ref JCAP 11 (2025) 048

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2605.06192 2026-05-08 cs.CV cs.AI cs.RO 67%

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

EA-WM:事件感知生成世界模型与结构运动-视觉动作场

Zhaoyang Yang, Yurun Jin, Lizhe Qi, Cong Huang, Kai Chen

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) DeepCybo(深瞳)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。

Comments Preprint. 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2605.06311 2026-05-08 cs.RO 81%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 数据集与评测 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏