arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-13 至 2026-08-13 共收录 24 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 22 篇

2510.06710 2026-08-13 cs.RO 版本更新 94%

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11671 2026-08-13 cs.RO 新提交 91%

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

StellaVLA:用于通用视觉-语言-动作模型的上下文结构化演示

Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 StellaVLA是一种测试时基于结构化演示适应的VLA框架,通过双训练设计提升泛化性,在VLA-Arena等基准上表现优于现有模型,可助力VLA模型适应OOD任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09448 2026-08-13 cs.RO cs.CV 版本更新 91%

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17598 2026-08-13 cs.RO cs.CV 版本更新 90%

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 89%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 85%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 84%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 83%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 83%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 82%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 82%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00836 2026-08-13 cs.RO cs.AI cs.SY eess.SY 版本更新 81%

From World Models to World Action Models: A Concise Tutorial for Robotics

从世界模型到世界动作模型:面向机器人学的简明教程

Xiaoxiong Zhang, Xiong Zeng, Wei Zhang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本教程提出世界模型作为动作条件预测模型的设计空间视图,分类为观测空间和状态空间模型,并引入世界动作模型,总结四种代表性范式,为具身预测与控制提供结构化分类。

Comments Project page: https://clearlab-sustech.github.io/WorldModelSurvey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12186 2026-08-13 astro-ph.SR astro-ph.GA 新提交 80%

Nascent Embedded-protostar Survey in Taurus (NEST) I: Protostellar Multiplicity

金牛座新生原恒星嵌入巡天(NEST)I:原恒星多重性

Aislinn C. Plante, John J. Tobin, Patrick D. Sheehan, Noshin Yesmin, Nicholas P. Ballering, Tyler L. Bourke, Josh Eisner, Zhi-Yun Li

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究通过ALMA与VLA观测结合档案数据,统计金牛座原恒星多重性,发现其多重性显著高于猎户座、英仙座,暗示金牛座保留更多原始多重系统,且存在两种不同形成途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 70%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 57%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11708 2026-08-13 cs.HC cs.GR 新提交 50%

A Browser-Based Gesture-Driven Avatar Interaction Framework for Metaverse Onboarding Environments

面向元宇宙入门环境的基于浏览器的手势驱动虚拟化身交互框架

Deepti Parachuri, Chhayank Sahu, Sameer Singh Choudhary

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种面向元宇宙入门环境的基于浏览器的手势驱动交互框架,结合Google MediaPipe手势识别与两种移动技术,经5人评估验证,实现无控制器的轻量交互。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11450 2026-08-13 cond-mat.mes-hall cond-mat.str-el 新提交 50%

Layer-Number-Controlled Symmetry Breaking and Surface-State Transport in Rhombohedral Graphene Multilayers

层数可控的菱面石墨烯多层膜中的对称性破缺与表面态输运

Bosai Lyu, Jian Zheng, Kai Liu, Yulu Ren, Size Wu, Yating Sha, Shuhan Liu, Youngju Park, Kenji Watanabe, Takashi Taniguchi, Jinfeng Jia, Zhiwen Shi, Jeil Jung, Weidong Luo, Guorui Chen

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过电输运测量发现菱面石墨烯多层膜的相变临界位移场具有特殊层依赖关系,确立层数为调控其关联与拓扑相的关键旋钮,还观测到表面态主导的输运特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23654 2026-08-13 nucl-ex nucl-th 50%

Probing nuclear interactions à la Rutherford: Insights on $^4$He from $α$ scattering

探测核相互作用 à la Rutherford: 从α散射洞察$^4$He

F. Cappuzzello, V. Soukeras, S. Bacca, D. Carbone, M. Cavallaro, L. C. Chamon, I. Lombardo, G. Orlandini, M. Viviani, C. Agodi, H. -W. Becker, G. A. Brischetto, S. Calabrese, C. Ciampi, M. Cicerchia, M. Cinausero, I. Ciraldo, D. Dell'Aquila, M. Fisichella, C. Frosin, A. Hacisalihoglu, M. Hilcker, A. Kievsky, Y. Kucuk, T. Marchi, O. Sgouros, A. Spatafora, D. Torresi, M. Vigilante, A. Yildirim

专题命中 VLA模型 :action model(abstract)

AI总结 通过高灵敏度$^4$He+$^4$He散射实验和谱线形状分析,结合电子散射核密度模型,研究$^4$He第一激发共振态,发现当前核相互作用模型能合理描述数据,但需进一步改进少体开放量子系统建模。

Journal ref Nature Communications 17, 8003 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19850 2026-08-13 cond-mat.stat-mech cond-mat.dis-nn cond-mat.soft nlin.AO physics.bio-ph 版本更新 50%

Starvation suppression in dense scale-free metabolic networks: Dynamical mean-field analysis of catalytic reaction networks

无营养抑制的无标度代谢网络:密集催化反应网络的动态平均场分析

Kota Mitsumoto, Shuji Ishihara

专题命中 VLA模型 :action model(abstract)

AI总结 研究无标度代谢网络在营养贫乏条件下的代谢 starvation 转变,通过动态平均场理论揭示网络拓扑对代谢动态的影响,发现无标度拓扑在营养限制下具有动态优势。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05703 2026-08-13 quant-ph 版本更新 50%

Simple and efficient end-to-end quantum thermal and ground state preparation

端到端高效量子热态和基态制备方法简化

Zhiyan Ding, Yongtao Zhan, John Preskill, Lin Lin

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于系统-环境相互作用的高效量子热态和基态制备算法,通过设计环境和相互作用哈密顿量,实现端到端高效制备并提供理论保证。

Journal ref Nat. Phys. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08722 2026-08-13 cs.CR 50%

SilentLedger: Privacy-Preserving Auditing for Blockchains with Complete Non-Interactivity

Zihan Liu, Xiaohu Wang, Chao Lin, Minghui Xu, Debiao He, Xinyi Huang

专题命中 VLA模型 :action model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 75%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏