arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9088 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2603.26666 2026-03-30 cs.RO 91%

VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation

VLA-OPD: 通过在线策略蒸馏连接离线SFT与在线RL以构建视觉-语言-动作模型

Zhide Zhong, Haodong Yan, Junfeng Li, Junjie He, Tianran Zhang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出VLA-OPD框架,通过在线策略蒸馏结合离线SFT与在线RL,解决预训练模型在部署中的分布偏移和灾难性遗忘问题,提升样本效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO 91%

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-03-25 cs.CV 91%

VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Haozhe Wang, Weibin Li, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 91%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 91%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12942 2026-03-16 cs.RO 91%

ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries

ReMem-VLA:通过双层递归查询增强视觉-语言-动作模型的记忆能力

Hang Li, Fengyi Shen, Dong Chen, Liudi Yang, Xudong Wang, Jinkui Shi, Zhenshan Bing, Ziyuan Liu, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center(华为海森堡研究中心) University of Freiburg(弗赖堡大学) Nanjing University(南京大学) Huawei Technologies(华为技术)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 ReMem-VLA通过双层递归查询机制提升视觉-语言-动作模型的记忆能力,结合帧级和块级记忆查询,增强短期和长期记忆,通过端到端训练实现上下文聚合与维护,优于现有基线模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09542 2026-03-11 cs.RO 91%

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

NS-VLA:迈向神经符号视觉-语言-动作模型

Ziyue Zhu, Shangyang Wu, Shuai Zhao, Zhiqiu Zhao, Shengjie Li, Yi Wang, Fang Li, Haoran Luo

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 NS-VLA通过在线强化学习提出神经符号视觉-语言-动作模型,解决VLA在学习可重用原始构件、减少数据依赖和扩展探索能力方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08361 2026-03-10 cs.CV 91%

$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation

$Δ$VLA:通过世界知识变化引导的视觉-语言-动作模型

Yijie Zhu, Jie He, Rui Shao, Kaishen Yuan, Tao Tan, Xiaochen Yuan, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Macao Polytechnic University(澳门理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 $Δ$VLA通过建模世界知识变化,结合先验引导和潜在空间学习,提升机器人动作生成的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08113 2026-03-10 cs.CV 91%

SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving

SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型

Zihan You, Hongwei Liu, Chenxu Dang, Zhe Wang, Sining Ang, Aoqi Wang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) Zhili College, Tsinghua University(紫荆学院,清华大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00919 2026-03-10 cs.RO 91%

Green-VLA: Staged Vision-Language-Action Model for Generalist Robots

Green-VLA: 通用机器人中的分阶段视觉-语言-动作模型

I. Apanasevich, M. Artemyev, R. Babakyan, P. Fedotova, D. Grankin, E. Kupryashin, A. Misailidi, D. Nerus, A. Nutalapati, G. Sidorov, I. Efremov, M. Gerasyov, D. Pikurov, Y. Senchenko, S. Davidenko, D. Kulikov, M. Sultankin, K. Askarbek, O. Shamanin, D. Statovoy, E. Zalyaev, I. Zorin, A. Letkin, E. Rusakov, A. Silchenko, V. Vorobyov, S. Sobolnikov, A. Postnikov

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 Green-VLA是一种面向真实环境的分阶段视觉-语言-动作模型,通过多阶段训练和强化学习对齐,提升机器人在多样化形态上的泛化能力和性能。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06202 2026-03-09 cs.RO 91%

ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval

ExpReS-VLA: 通过经验回放和检索专门化视觉-语言-动作模型

Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson, Jeff Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 ExpReS-VLA通过经验回放和检索增强,提升VLA模型在特定任务中的适应能力与性能。

Comments 8 pages, 4 figures, 3 tables, accepted to International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20321 2026-02-02 cs.RO 91%

TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation

TaF-VLA:面向力感知操控的视觉-语言-动作模型中的触觉-力对齐

Yuzhe Huang, Pei Lin, Wanlin Li, Daohan Li, Jiajun Li, Jiaming Jiang, Chenxi Xiao, Ziyuan Jiao

机构 * Beihang University(北航大学) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 TaF-VLA通过触觉-力对齐提升视觉-语言-动作模型在力感知操控中的性能。

Comments 17pages,9fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19634 2026-01-28 cs.RO cs.MM 91%

AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation

AC^2-VLA: 基于动作-上下文的自适应计算在视觉-语言-动作模型中的应用以实现高效的机器人操作

Wenda Yu, Tianshi Wang, Fengling Li, Jingjing Li, Lei Zhu

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 AC^2-VLA通过结合动作上下文实现自适应计算,提升机器人操作的效率,减少计算成本并保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24426 2026-01-01 cs.RO 91%

Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning

反事实VLA:具有自反思能力的视觉-语言-动作模型与自适应推理

Zhenghao "Mark" Peng, Wenhao Ding, Yurong You, Yuxiao Chen, Wenjie Luo, Thomas Tian, Yulong Cao, Apoorva Sharma, Danfei Xu, Boris Ivanovic, Boyi Li, Bolei Zhou, Yan Wang, Marco Pavone

机构 * NVIDIA UCLA(加州大学洛杉矶分校) Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 CF-VLA通过自反思机制提升自动驾驶轨迹精度与安全性,实现自适应推理与因果修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05107 2025-12-25 cs.RO 91%

STARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action Models

STARE-VLA:渐进式阶段感知强化用于视觉-语言-动作模型微调

Feng Xu, Guangyao Zhai, Xin Kong, Tingzhong Fu, Daniel F. N. Gordon, Xueli An, Benjamin Busam

机构 * Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 STARE-VLA通过渐进式阶段感知强化方法,提升视觉-语言-动作模型的动作准确性,实现SimplerEnv和ManiSkill3任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17199 2025-11-24 cs.CV 91%

VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation

VLA-4D: 将4D意识嵌入视觉-语言-动作模型中以实现时空一致的机器人操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 VLA-4D通过4D意识增强视觉-语言-动作模型,实现时空一致的机器人操作,提升动作执行的空间平滑性和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16617 2025-10-21 cs.RO 91%

MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation

Ruihan Zhao, Tyler Ingebrand, Sandeep Chinchali, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14902 2025-10-17 cs.RO 91%

VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation

Han Zhao, Jiaxuan Zhang, Wenxuan Song, Pengxiang Ding, Donglin Wang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13725 2025-06-17 cs.RO 91%

CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Yuxin Huang, Han Zhao, Donglin Wang, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州)) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06919 2025-01-14 cs.RO 91%

Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing

Muhamamd Haris Khan, Selamawit Asfaw, Dmitrii Iarchuk, Miguel Altamirano Cabrera, Luis Moreno, Issatay Tokmurziyev, Dzmitry Tsetserukou

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments Accepted to IEEE/ACM HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19590 2024-10-01 cs.RO 91%

RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model

Shunlei Li, Jin Wang, Rui Dai, Wanyu Ma, Wing Yin Ng, Yingbai Hu, Zheng Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06039 2024-08-20 cs.RO 91%

Bi-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Dexterous Manipulations

Koffivi Fidèle Gbagbe, Miguel Altamirano Cabrera, Ali Alabbas, Oussama Alyunes, Artem Lykov, Dzmitry Tsetserukou

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

Comments The paper was accepted to the IEEE SMC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09448 2026-08-13 cs.RO cs.CV 版本更新 91%

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17787 2026-07-22 cs.RO cs.AI 版本更新 91%

AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models

AnchorRefine:基于轨迹锚点和残差细化的轨迹-锚点与残差细化的视觉-语言-动作模型

Tingzheng Jia, Kan Guo, Lanping Qian, Yongli Hu, Daxin Tian, Guixian Qu, Chunmian Lin, Baocai Yin, Jiapu Wang

机构 * Beijing University of Technology(北京理工大学) Beihang University(北航) Nanjing University of Science and Technology(南京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出AnchorRefine框架,通过分解视觉-语言-动作动作建模为轨迹锚点和残差细化,提升几何和接触精度,实验表明在模拟和现实任务中均取得显著提升。

Comments The authors have decided to withdraw this manuscript because the work requires substantial revision and further experimental validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08862 2026-07-15 cs.RO cs.LG 版本更新 91%

APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

APPLV: 从视觉-语言-动作模型中自适应学习规划器参数

Yuanjie Lu, Beichen Wang, Zhengqi Wu, Yang Li, Xiaomin Lin, Chengzhi Mao, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17639 2026-06-17 cs.RO cs.AI 版本更新 91%

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models

RLRC:基于强化学习的压缩视觉-语言-动作模型恢复

Yuxuan Chen, Yixin Han, Yize Huang, Xiao Li

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Key Laboratory of Intelligent Robotics(上海智能机器人重点实验室) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出RLRC三阶段压缩恢复流程,通过结构化剪枝、SFT和强化学习恢复以及量化,实现8倍内存减少和2.3倍推理加速,同时保持任务成功率。

Comments 8 pages, 10 figures; accepted by RA-L 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8864-8871, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15631 2026-06-16 cs.RO cs.AI 新提交 91%

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

检索,不重新训练:在测试时将视觉语言动作模型扩展到新任务

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室) Korea University(高丽大学)

专题命中 VLA模型 :action model(title,abstract);vision language action(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出检索增强策略,通过一次训练冻结模型,部署时仅添加检索数据即可适应新任务,无需逐任务微调,在跨本体泛化中优于基线。

Comments https://recap-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 91%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 91%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03480 2026-04-21 cs.RO cs.AI 91%

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

SafeVLA: 通过约束学习实现视觉-语言-动作模型的安全对齐

Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出SafeVLA方法,通过约束学习整合安全约束,有效降低安全违规成本并提升任务成功率,同时确保安全性和泛化能力。

Comments Accepted by NeurIPS 2025 Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏