arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-31 至 2026-07-31 共收录 12 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2607.26991 2026-07-31 cs.RO 版本更新 94%

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

RL²-VLA:面向视觉-语言-动作模型的测试时缩放自适应RL隐成分引导

Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) Singapore Technologies Engineering(新加坡科技工程公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 针对VLA模型分布外任务性能下降问题,提出基于VLA隐空间的自适应推理时引导框架RL²,仅在预测失败时激活成分引导,在SIMPLER等基准上分布外成功率最高提升17.3%,可迁移至真实世界。

Comments Code and models are available at https://rl2-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 90%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27782 2026-07-31 cs.RO cs.AI 新提交 89%

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

RedFlow:将失败重定向为流匹配VLA策略的动作级修正

Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 RedFlow是将失败转化为动作级修正监督的离线RL框架,在LIBERO基准及真实操纵任务上,其真实成功率达74.7%,优于现有离线RL基线,样本量仅为强在线方法的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28405 2026-07-31 cs.AI cs.LG 新提交 84%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04999 2026-07-31 cs.RO cs.AI cs.LG 版本更新 83%

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

CLAM:基于未标记演示的连续潜在动作模型用于机器人学习

Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CLAM通过连续潜在动作标签和联合训练动作解码器,有效解决复杂连续控制任务中未标记数据的学习问题,实现在DMControl和MetaWorld等基准及真实机器人上的性能提升。

Comments Latent Action Models, Self-supervised Pretraining, Learning from Videos

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27549 2026-07-31 cs.RO cs.AI cs.CV cs.LG 新提交 81%

Cross-Embodiment Transfer via Behavior-Aligned Representations

基于行为对齐表征的跨具身迁移

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究所)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究提出在视觉-语言-动作模型中采用行为对齐表征,开发仿真基准验证其可提升跨具身迁移,使真实机器人任务完成进度提升28%。

Comments Project page: https://ajaysridhar.com/barx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28391 2026-07-31 cs.RO 新提交 79%

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

TacWAM:锚点引导的力学感知触觉世界动作模型

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23969 2026-07-31 cs.RO 版本更新 79%

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28243 2026-07-31 cs.CV cs.AI 新提交 76%

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tianji KernalMind Co., Ltd.(天机芯智有限公司) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学)

专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI

AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。

Comments project page: https://egogenesis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28251 2026-07-31 eess.SY cs.SY 新提交 67%

Self-Evolving Learning for Embodied AI with Criticality Model

基于临界模型的具身智能自进化学习

Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract)

AI总结 本文提出基于临界模型的具身智能自进化学习方法,通过状态级临界模型引导采样易失败场景,在多类具身任务中显著降低失败率,性能优于基线及同类先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27439 2026-07-31 astro-ph.HE astro-ph.IM 新提交 67%

Radio Follow-Up of Einstein Probe Fast X-Ray Transients

爱因斯坦探针快速X射线暂现源的射电后续观测

Carmen Choza, Joe S. Bright, Francesco Carotenuto, Alex Pollak, Rob Fender, Andrew Siemion

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文针对20个爱因斯坦探针2024年探测的快速X射线暂现源开展射电后续观测,发现2个存在射电对应体,揭示其异质性,下一代阵列将助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27520 2026-07-31 stat.ME 新提交 50%

The Continuous Latent Ornstein-Uhlenbeck Dynamics Framework: A Scalable Latent Process Model for Multivariate Longitudinal Categorical Data

连续潜变量奥恩斯坦-乌伦贝克动力学框架:面向多变量纵向分类数据的可扩展潜过程模型

Zhennan Wu, Yijie Wang, Xiaoqing Huang

专题命中 VLA模型 :action model(abstract)

AI总结 本文针对多变量纵向分类数据的分析挑战,提出CLOUD框架,结合IRT测量组件与时变OU过程,经模拟和ALS数据验证,可灵活刻画受试者特异性疾病演化。

详情

展开后加载摘要…

URL PDF HTML 收藏