arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9119 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9119 篇

2603.03596 2026-03-10 cs.RO cs.LG 85%

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

MEM:多尺度具身记忆用于视觉语言动作模型

Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springenberg, Sergey Levine, Chelsea Finn, Danny Driess

专题命中 VLA模型 :vision language action(title);action model(title);分类 cs.RO、cs.LG

AI总结 MEM通过结合多模态记忆实现长期视觉语言动作任务的高效执行与适应性策略调整。

Comments Website: https://pi.website/research/memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22697 2025-12-01 cs.RO cs.CL cs.CV 85%

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05642 2025-11-11 cs.RO cs.AR cs.CV cs.SY eess.SY 85%

Lite VLA: Efficient Vision-Language-Action Control on CPU-Bound Edge Robots

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber-Physical Systems, Clark Atlanta University(克雷克阿特拉大学计算机物理系统系) Siemens Corporation(西门子公司)

专题命中 VLA模型 :vision-language-action(title);VLA(title);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05578 2025-09-09 cs.AI cs.RO 85%

OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision

Ruixun Liu, Lingyu Kong, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究所) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 85%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10232 2026-08-12 cs.RO cs.AI cs.LG 新提交 85%

FACT: Failure-Aware Causal Training for World-Action Models

FACT:面向世界-动作模型的故障感知因果训练方法

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02365 2026-08-04 cs.AI cs.LG cs.RO 新提交 85%

Faster-WAM: Do World Action Models Need Deep Action Modules?

Faster-WAM:世界动作模型需要深度动作模块吗?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Celia Team(华为Celia团队) Labs(2012实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交 85%

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02902 2026-04-01 cs.RO cs.AI cs.LG 85%

VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling

VLA模型比你想象的更通用:重新审视物理和空间建模

Weiqi Li, Quande Zhang, Ruifeng Zhai, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究指出VLA模型在新视角和视觉扰动下表现下降源于空间建模不对齐,提出轻量级一 shot 调整框架,通过FTM和FLA提升模型鲁棒性,验证了少量视觉适应即可恢复视角泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO 85%

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18342 2026-03-20 cs.RO cs.AI cs.LG 85%

Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model

将不确定性移至关键时刻:面向VLA模型可靠不确定性的量化

Yanchuan Tang, Taowen Wang, Yuefei Chen, Boxuan Zhang, Qiang Guan, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Kent State University(肯特州立大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出统一的不确定性量化方法,通过最大值滑动窗口池化保留瞬时风险信号,结合运动感知稳定性加权强调不稳定行为的高频动作振荡,并通过贝叶斯优化进行DOF自适应校准,提升失败预测准确性和故障检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 85%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 85%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11872 2025-12-17 cs.RO cs.AI cs.CV 85%

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

WAM-Diff: 一种结合MoE和在线强化学习的掩码扩散VLA框架用于自动驾驶

Mingwang Xu, Jiahao Cui, Feipeng Cai, Hanlin Shang, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(云网智能科技有限公司)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WAM-Diff通过结合MoE和在线强化学习的掩码扩散框架,提升自动驾驶轨迹生成的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11047 2025-12-16 cs.RO cs.AI cs.CV 85%

WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control

WholeBodyVLA: 向统一的潜变量VLA迈进以实现全身体姿操控控制

Haoran Jiang, Jin Chen, Qingwen Bu, Li Chen, Modi Shi, Yanjie Zhang, Delong Li, Chuanzhe Suo, Chuang Wang, Zhihui Peng, Hongyang Li

机构 * Fudan University(复旦大学) OpenDriveLab & MMLab at The University of Hong Kong(香港大学开放驾驶实验室及多模态实验室) AgiBot(AgiBot公司) SII(SII研究所)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 WholeBodyVLA通过统一的潜变量学习框架和专门设计的强化学习策略,实现了大空间人形运动-操控的精准控制与高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11584 2025-12-15 cs.LG cs.AI cs.RO 85%

Atomic Action Slicing: Planner-Aligned Options for Generalist VLA Agents

原子动作切片:为通用VLA代理的规划对齐选项

Stefan Tabakov, Asen Popov, Dimitar Dimitrov, S. Ensiye Kiyamousavi, Vladimir Hristov, Boris Kraychev

机构 * Sofia University 'St. Kliment Ohridski(索菲亚大学 '圣克莱门特·欧里基斯基') Technical University of Sofia(索菲亚技术大学) EEMCS, University of Twente(EEMCS,特文特大学) GATE Institute, Sofia University 'St. Kliment Ohridski(GATE研究所,索菲亚大学 '圣克莱门特·欧里基斯基')

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出原子动作切片方法,通过分解长周期演示为短的原子动作,提升VLA代理的任务成功率,并公开发布相关数据集。

Comments The 41st ACM/SIGAPP Symposium On Applied Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18950 2025-11-25 cs.RO cs.CV cs.LG 85%

Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation

Compressor-VLA:基于指令的视觉标记压缩用于高效的机器人操作

Juntao Gao, Feiyang Ye, Jing Zhang, Wenjing Qian

机构 * School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) LiAuto Inc.(LiAuto公司) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology(计算智能与智能系统北京市重点实验室,北京理工大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Compressor-VLA通过指令引导的视觉标记压缩,提升机器人操作的效率与精度。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16263 2025-10-22 cs.RO cs.AI cs.CV 85%

NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?

Jierui Peng, Yanyan Zhang, Yicheng Duan, Tuo Liang, Vipin Chaudhary, Yu Yin

机构 * Department of Computer & Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Homepage: https://vulab-ai.github.io/NEBULA-Alpha/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16845 2025-10-15 cs.CV cs.AI cs.LG 85%

NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows

Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Nikita Lyubaykin, Andrei Polubarov, Alexander Derevyagin, Vladislav Kurenkov

机构 * ETH Zürich(苏黎世联邦理工学院) MIPT(莫斯科国立信息安全大学) Skoltech(斯克里普斯基技术大学) Innopolis University(因诺波利斯大学) HSE(俄罗斯高等经济学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.CV、cs.AI、cs.LG

Comments https://github.com/dunnolab/NinA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07134 2025-10-09 cs.RO cs.AI cs.CV 85%

TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking

Jiahang Liu, Yunpeng Qi, Jiazhao Zhang, Minghan Li, Shaoan Wang, Kui Wu, Hanjing Ye, Hong Zhang, Zhibo Chen, Fangwei Zhong, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot USTC(中国科学技术大学) BAAI(北京人工智能研究院) Beihang University(北京航空航天大学) SUSTech(四川大学) Beijing Normal University(北京师范大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Project page: https://pku-epic.github.io/TrackVLA-plus-plus-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23224 2025-09-30 cs.RO cs.AI cs.CV cs.SY eess.SY 85%

Leave No Observation Behind: Real-time Correction for VLA Action Chunks

Kohei Sendai, Maxime Alvarez, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09674 2025-09-12 cs.RO cs.AI cs.CL cs.LG 85%

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning

Haozhan Li, Yuxin Zuo, Jiale Yu, Yuhao Zhang, Zhaohui Yang, Kaiyan Zhang, Xuekai Zhu, Yuchen Zhang, Tianxing Chen, Ganqu Cui, Dehui Wang, Dingxiang Luo, Yuchen Fan, Youbang Sun, Jia Zeng, Jiangmiao Pang, Shanghang Zhang, Yu Wang, Yao Mu, Bowen Zhou, Ning Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05485 2025-05-13 cs.RO cs.AI cs.CV 85%

HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation

Yi Li, Yuquan Deng, Jesse Zhang, Joel Jang, Marius Memmel, Raymond Yu, Caelan Reed Garrett, Fabio Ramos, Dieter Fox, Anqi Li, Abhishek Gupta, Ankit Goyal

机构 * NVIDIA University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments update related work and results on VQA benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11974 2024-12-18 cs.RO cs.AI cs.CL cs.CV 85%

Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning

Qi Sun, Pengfei Hong, Tej Deep Pala, Vernon Toh, U-Xuan Tan, Deepanway Ghosal, Soujanya Poria

专题命中 VLA模型 :action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05821 2024-12-10 cs.RO cs.CV cs.LG 85%

Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks

Pranav Guruprasad, Harshvardhan Sikka, Jaewoo Song, Yangyue Wang, Paul Pu Liang

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

Comments 16 Pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 84%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 84%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10413 2026-08-12 cs.CV 新提交 84%

DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

DriveVLA-M0:面向自动驾驶的故障感知记忆增强方法

Zebin Xing, Yupeng Zheng, Qiang Chen, Linbo Wang, Yichen Zhang, Pengxuan Yang, Junli Wang, Deheng Qian, Xiaoqing Ye, Junyu Han, Yifeng Pan, Qichao Zhang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd.(重庆长安科技有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 本文提出DriveVLA-M0,一种具备故障感知潜在记忆的检索增强型VLA模型,通过故障案例记忆与针对性修正机制,在NAVSIM基准上优于现有方法,实现自动驾驶性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 84%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 84%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏