arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-16 至 2026-03-16 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2603.12942 2026-03-16 cs.RO 91%

ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries

ReMem-VLA:通过双层递归查询增强视觉-语言-动作模型的记忆能力

Hang Li, Fengyi Shen, Dong Chen, Liudi Yang, Xudong Wang, Jinkui Shi, Zhenshan Bing, Ziyuan Liu, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center(华为海森堡研究中心) University of Freiburg(弗赖堡大学) Nanjing University(南京大学) Huawei Technologies(华为技术)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 ReMem-VLA通过双层递归查询机制提升视觉-语言-动作模型的记忆能力,结合帧级和块级记忆查询,增强短期和长期记忆,通过端到端训练实现上下文聚合与维护,优于现有基线模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO 88%

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12772 2026-03-16 cs.CV cs.LG cs.RO 88%

PVI: Plug-in Visual Injection for Vision-Language-Action Models

PVI:插件式视觉注入用于视觉-语言-动作模型

Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(Lionrock人工智能实验室) China Merchants Group(中国商人集团)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 85%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12553 2026-03-16 cs.RO cs.CV 73%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11041 2026-03-16 cs.CV cs.RO 62%

DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving

DynVLA:为自动驾驶中的动作推理学习世界动态

Shuyao Shang, Bing Zhan, Yunfei Yan, Yuqi Wang, Yingyan Li, Yasong An, Xiaoman Wang, Jierui Liu, Lu Hou, Lue Fan, Zhaoxiang Zhang, Tieniu Tan

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 DynVLA提出一种新的Coot方法Dynamics CoT,通过预测紧凑世界动态来提升决策质量,实验表明其优于Textual CoT和Visual CoT。

Comments 18 pages, 10 figures. Project Page: https://yaoyao-jpg.github.io/dynvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12863 2026-03-16 hep-ph astro-ph.HE 50%

A basic model for high energy cosmic ray interactions

高能宇宙射线相互作用的基本模型

Sergey Ostapchenko, Tanguy Pierog, Günter Sigl

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一个基于Reggeon场论的高能宇宙射线相互作用蒙特卡罗生成器,提供透明物理、充足参数自由度和高效计算的模型,用于研究空气簇射微观特性及与加速器数据的兼容性。

Comments accepted for PRD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11143 2026-03-16 astro-ph.EP 50%

Martian concretion sizes predicted from two independently constrained inputs: atmospheric dust grain size and obliquity-forced wetting duration

火星中混凝土尺寸的预测:来自两个独立约束输入的预测:大气尘粒大小和倾角驱动的湿润持续时间

Samuel Cody

专题命中 VLA模型 :action model(abstract)

AI总结 研究通过大气尘粒大小和倾角驱动湿润持续时间两个独立约束输入,揭示火星混凝土尺寸一致性源于全球统一的细尘颗粒限制生长,形成机制与液态水接触尘土有关,且每个混凝土记录单一湿润事件。

Comments 19 pages, 3 figures, 2 tables. Preprint; not yet peer-reviewed. V1.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07381 2026-03-16 cs.CR 50%

SoK: Evolution, Security, and Fundamental Properties of Transactional Systems

SoK:事务系统的发展、安全性和基本特性

Sky Pelletier Waterpeace, Nikolay Ivanov

专题命中 VLA模型 :action model(abstract)

AI总结 本文通过分类163篇事务安全研究论文,揭示了事务系统发展历程中的安全问题,提出RANCID属性集以应对现代事务处理需求,并指出当前研究对DLT的偏重及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09604 2026-03-16 cs.DC 50%

High-performance Vector-length Agnostic Quantum Circuit Simulations on ARM Processors

基于ARM处理器的高性能无向量长度量子电路模拟

Ruimin Shi, Gabin Schieffer, Pei-Hung Lin, Maya Gokhale, Andreas Herten, Ivy Peng

专题命中 VLA模型 :VLA(abstract)

AI总结 本文提出了一种无向量长度量子电路模拟设计,通过优化技术在ARM处理器上实现高性能模拟,实验结果显示在A64FX上加速达4.5倍。

Comments To be published in IPDPS2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 1 篇

2512.18396 2026-03-16 cs.RO 70%

AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

AOMGen: 为关节物体操控生成逼真、物理一致的演示

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。

Comments Accepted by CVPR Findings2026

详情

展开后加载摘要…

URL PDF HTML 收藏