arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-11 至 2026-05-11 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 2 篇

2605.07794 2026-05-11 cs.RO 79%

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

NoiseGate: 在世界动作模型中学习每潜在时间步的调度作为信息门控

Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra(JDT AI 基础设施) Tianjin University(天津大学)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.RO

AI总结 本文提出NoiseGate,通过学习每潜在时间步的调度作为信息门控策略,改进世界动作模型中的动作生成与未来观察建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07079 2026-05-11 cs.CV cs.AI cs.LG cs.RO 70%

Learning Visual Feature-Based World Models via Residual Latent Action

通过残差潜在动作学习基于视觉特征的世界模型

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出RLA-WM世界模型,通过流匹配预测残差潜在动作,优于现有特征和视频扩散模型,且在速度和效率上更优,同时开发了两项机器人学习技术。

详情

展开后加载摘要…

URL PDF HTML 收藏