arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-26 至 2026-02-26 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2503.02310 2026-02-26 cs.RO cs.CV 91%

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

PD-VLA:通过并行解码加速集成动作分块的视觉-语言-动作模型

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Han Zhao, Wei Zhao, Zhide Zhong, Zongyuan Ge, Zhijun Li, Donglin Wang, Jun Ma, Lujia Wang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 PD-VLA通过并行解码框架提升视觉-语言-动作模型在动作分块中的效率与性能

Comments Accepted by IROS 2025, updated results on LIBERO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20659 2026-02-26 cs.AI 89%

Recursive Belief Vision Language Action Models

递归信念视觉语言动作模型

Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel

机构 * Department of Engineering Design, Indian Institute of Technology, Madras, Chennai, India(工程设计系,印度理工学院,马德拉斯,钦奈,印度)

专题命中 VLA模型 :action model(title,abstract);vision language action(title);vision-language-action(abstract);VLA(abstract)

AI总结 RB-VLA通过信念与意图联合条件化扩散策略,实现长周期任务的高效执行,显著提升成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21633 2026-02-26 cs.RO cs.AI cs.CV 87%

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

自校正视觉-语言-动作模型:通过稀疏世界想象实现在线动作细化

Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 SC-VLA通过稀疏世界想象实现自校正,提升机器人操作任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21736 2026-02-26 cs.RO 85%

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

联合对齐的潜在动作:迈向大规模野外VLA预训练

Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 JALA通过联合对齐的潜在动作预训练框架,提升从人类数据中大规模预训练视觉-语言-动作模型的效率与性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21531 2026-02-26 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 85%

LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies

LiLo-VLA:通过链接的对象为中心策略实现组合长周期操控

Yue Yang, Shuo Cheng, Yu Fang, Homanga Bharadhwaj, Mingyu Ding, Gedas Bertasius, Daniel Szafir

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 LiLo-VLA通过链接的对象为中心策略实现长周期操控,通过模块化框架实现零样本泛化,提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22010 2026-02-26 cs.RO cs.CV 73%

World Guidance: World Modeling in Condition Space for Action Generation

世界引导:在条件空间中进行世界建模以生成动作

Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang, Weiheng Zhong, Zhengbang Zhu, Yuxiao Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 WoG通过在条件空间中建模未来观测,提升视觉-语言-动作模型的动作生成能力与泛化性能。

Comments Project Page: https://selen-suyue.github.io/WoGNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21546 2026-02-26 cs.LG 57%

Mamba Meets Scheduling: Learning to Solve Flexible Job Shop Scheduling with Efficient Sequence Modeling

Mamba 与调度相遇:学习解决灵活作业车间调度的高效序列建模

Zhi Cao, Cong Zhang, Yaoxin Wu, Yaqing Hou, Hongwei Ge

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出基于Mamba的高效序列建模方法,用于解决灵活作业车间调度问题,实现更快的求解速度和更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22105 2026-02-26 astro-ph.HE hep-ex hep-ph 50%

Forward hadron production in proton-air collisions above LHC energies through the fluctuations of extensive air showers

质子-空气碰撞中通过扩展大气簇射的波动研究高能范围内的重子生产

Lorenzo Cazon, Ruben Conceição, Miguel Alexandre Martins, Felix Riehn

专题命中 VLA模型 :action model(abstract)

AI总结 通过研究质子-空气碰撞中扩展大气簇射的波动,揭示高能范围内强子生产的新的探测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21913 2026-02-26 math.NA cs.NA 50%

A fully iterative adaptive energy-based approach for monotone elliptic problems

一种完全迭代的自适应能量基方法用于单调椭圆问题

Raphael Leu, Thomas P. Wihler

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种基于能量减少原理的完全迭代自适应方法,用于求解单调椭圆问题,通过自适应细化有限元空间和共轭梯度方法实现最优收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21488 2026-02-26 q-bio.TO 50%

Towards Structure-Aware Surrogate Modeling: Explicit Region Interaction Improves Knee Contact Stress Prediction

面向结构感知的代理建模:显式区域交互提高膝关节接触应力预测

Zhengye Pan, Jianwei Zuo, Jiajia Luo

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出显式区域交互模型,用于提高膝关节接触应力预测的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2508.21112 2026-02-26 cs.RO cs.AI 86%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 动作表示与策略 :embodied foundation model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏