arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9088 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2510.09976 2026-06-26 cs.LG cs.RO 版本更新 90%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21372 2026-06-23 cs.RO cs.LG 新提交 90%

NAC: Neural Action Codec for Vision-Language-Action Models

NAC: 面向视觉-语言-动作模型的神经动作编解码器

Ahad Jawaid, Yu Xiang

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出神经动作编解码器(NAC),采用多尺度RVQGAN架构将短动作轨迹视为多通道1D信号进行压缩,以替代现有离散动作分词器,在LIBERO-10等任务中实现更低重建误差和更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新 90%

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14323 2026-06-02 cs.CR cs.AI cs.RO 90%

SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models

SilentDrift: 利用动作分块对视觉-语言-动作模型进行隐蔽后门攻击

Bingxin Xu, Yuzhang Shang, Binghui Wang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中央佛罗里达大学) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型中的动作分块与增量位姿表示导致的视觉开环漏洞,提出一种利用平滑步函数构建满足C2连续扰动的隐蔽黑盒后门攻击方法SilentDrift,并通过关键帧攻击策略实现高攻击成功率与低中毒率。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17111 2026-06-01 cs.RO cs.LG 90%

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

面向具身操作的高效视觉-语言-动作模型:系统综述

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA Nanjing University of Information Science and Technology(南京信息科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文系统综述了通过模型架构、感知特征、动作生成和训练/推理策略四个维度降低视觉-语言-动作模型延迟、内存占用及计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04733 2026-05-29 cs.CV cs.AI 90%

E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型

Yihong Tang, Haicheng Liao, Tong Nie, Junlin He, Ao Qu, Kehua Chen, Wei Ma, Zhenning Li, Lijun Sun, Chengzhong Xu

机构 * McGill University(麦吉尔大学) University of Macau(澳门大学) The Hong Kong Polytechnic University(香港理工大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29114 2026-05-29 cs.CR cs.LG cs.RO 90%

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

ReasonBreak: 探测自动驾驶中具备推理能力的视觉-语言-行动模型的脆弱性

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Qualcomm(高通)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文通过黑盒攻击方法,首次系统研究了具备推理能力的视觉-语言-行动模型在自动驾驶中面对真实输入扰动时的脆弱性,发现其推理和轨迹生成均易受攻击,导致碰撞率上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 90%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03983 2026-05-26 cs.RO cs.CV 90%

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

通过静态-动态解耦实现高效长程视觉-语言-动作模型

Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

机构 * Yale University(耶鲁大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出DySta框架,通过将视觉输入解耦为多级静态和动态令牌,减少上下文长度并复用KV缓存,实现高效多帧集成和推理,在基准测试和真实任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 90%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09512 2026-05-18 cs.RO cs.LG 90%

CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion

CLARE:通过自主适配器路由和扩展实现视觉-语言-动作模型的持续学习

Ralf Römer, Yi Zhang, Yuming Li, Angela P. Schoellig

机构 * Technical University of Munich(慕尼黑技术大学) TUM School of Computation, Information and Technology(TUM计算、信息与技术学院) Department of Computer Engineering, Learning Systems and Robotics Lab(计算机工程系、学习系统与机器人实验室) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI)) Robotics Institute Germany(德国机器人研究所) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 CLARE提出一种参数高效、无需示例的持续学习框架,通过自主扩展模型模块,实现机器人在新任务中保持旧知识,优于基于示例的方法。

Comments Accepted to IEEE Robotics and Automation Letters 2026. Project page: https://tum-lsy.github.io/clare. 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14851 2026-05-15 cs.CV cs.RO 90%

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving

AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶

Wenhui Huang, Songyan Zhang, Qihang Huang, Zhidong Wang, Zhiqi Mao, Collister Chua, Zhan Chen, Long Chen, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Harvard University, US(哈佛大学,美国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23073 2026-05-04 cs.LG cs.RO 90%

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

RL Token: 通过视觉-语言-动作模型实现在线强化学习的启动

Charles Xu, Jost Tobias Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出RL Token方法,通过轻量级在线强化学习微调预训练的视觉-语言-动作模型,提升真实任务的精度与速度,实验证明在四个真实机器人任务中显著提高任务效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24447 2026-04-28 cs.RO cs.AI 90%

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

跨XPUs的视觉-语言-动作模型特性分析:约束与加速以实现机器人部署

Kaijun Zhou, Qiwei Chen, Da Peng, Zhiyang Li, Xijun Li, Jinyu Gu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文研究了视觉-语言-动作模型在机器人上的部署问题,通过模型与硬件的协同分析,揭示了边缘加速器在成本、能耗和时间上的优化潜力,并提出DP-Cache和V-AEFusion方法提升性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17573 2026-04-28 cs.RO cs.DB cs.LG 90%

HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness

HeiSD:具有运动意识的具身视觉-语言-动作模型的混合推测解码

Zihao Zheng, Zhihao Mao, Sicheng Tian, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of EECS, Peking University(北京大学电子工程与科学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出HeiSD框架,结合draft-based和retrieval-based推测解码方法,通过验证跳过机制和序列放松接受策略提升效率,并引入基于运动的融合度量确定混合边界,实验证明在仿真和现实场景中均实现2.45倍以上的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10698 2026-04-27 cs.CV cs.AI 90%

AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models

AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型

Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Information Technology, Carleton University(卡尔顿大学信息技术学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出AugVLA-3D框架,通过整合深度估计提升视觉-语言-动作模型的3D特征表示,增强模型在复杂3D环境中的感知与动作预测能力。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20472 2026-04-23 cs.RO cs.LG 90%

Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models

时间差校准在连续任务中的应用:用于视觉-语言-动作模型

Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano, Aviv Tamar

机构 * Technion - Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出了一种用于连续任务的时间差校准方法,通过将Brier分数扩展到序列任务,将不确定性校准与强化学习结合,提高了视觉-语言-动作模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20347 2026-04-23 cs.RO cs.AI 90%

A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

面向自适应超声引导针插入与针跟踪的视觉-语言-动作模型

Yuelin Zhang, Qingpeng Ding, Longxiang Tang, Chengyu Fang, Shing Shin Cheng

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Automation Engineering, T Stone Robotics Institute, Shun Hing Institute of Advanced Engineering, Multi-Scale Medical Robotics Center, and Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系、T Stone机器人研究所、Shun Hing先进工程研究所、多尺度医疗机器人中心以及医学智能与XR研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出视觉-语言-动作模型,用于实现自适应超声引导针插入与跟踪,通过跨深度融合和跟踪条件化注册提升跟踪精度与插入成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14732 2026-04-21 cs.RO cs.LG 90%

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

世界价值-动作模型:面向视觉-语言-动作系统的隐式规划

Runze Li, Hongyin Zhang, Junxi Jin, Qixin Zeng, Zifeng Zhuang, Yiqi Tang, Shangke Lyu, Donglin Wang

机构 * Westlake University(西湖大学) Nanjing University Suzhou Campus(南京大学苏州校区)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出World-Value-Action模型,通过隐式规划提升视觉-语言-动作系统在长时域决策中的性能,通过学习潜在表示和价值函数实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 90%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15046 2026-03-17 cs.RO cs.AI 90%

AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation

AnoleVLA:基于深度状态空间模型的轻量级视觉-语言-动作模型用于移动操作

Yusuke Takagi, Motonari Kambara, Daichi Yashima, Koki Seno, Kento Tokura, Komei Sugiura

机构 * Keio University(keio大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出AnoleVLA,一种轻量级视觉-语言-动作模型,通过深度状态空间模型高效处理多模态序列,提升移动操作的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05275 2026-02-24 cs.RO cs.LG 90%

TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models

TwinVLA: 通过双单臂视觉-语言-动作模型实现数据高效的双臂操作

Hokyun Im, Euijin Jeong, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 TwinVLA通过模块化组合预训练的单臂视觉-语言-动作模型,实现了高效双臂操作,无需额外双臂数据训练。

Comments Accepted to ICLR 2026 (Poster). Project webpage : https://jellyho.github.io/TwinVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14058 2026-02-16 cs.RO cs.CV 90%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04315 2026-02-05 cs.RO cs.CV 90%

GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning

GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型

Guoqing Ma, Siheng Wang, Zeyu Zhang, Shan Yu, Hao Tang

机构 * CASIA(中国科学院自动化研究所) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00783 2026-01-23 cs.LG cs.RO 90%

Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment

Sigma:迈向心电图对齐的视觉-语言-动作模型的关键

Libo Wang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 Sigma模型通过整合深度语义理解和关联推理,实现了感知与动作的心电图式对齐,无需重新训练基础模型,提升了语义对齐和意图驱动行为的可重复性。

Comments The Sigma model has been open-sourced on Hugging Face. Weights, dataset, some scripts, and logs are all available. The link is: https://huggingface.co/Veltraxor/Sigma

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09527 2026-01-12 cs.CV cs.AI 90%

CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games

CombatVLA: 一种高效的视觉-语言-动作模型,用于3D动作角色扮演游戏中的战斗任务

Peng Chen, Pi Bu, Yingyao Wang, Xinyi Wang, Ziming Wang, Jie Guo, Yingxiu Zhao, Qi Zhu, Jun Song, Siran Yang, Jiamang Wang, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 CombatVLA是一种高效的视觉-语言-动作模型,用于3D动作角色扮演游戏中的战斗任务,通过高效的训练和推理方法,在战斗理解基准上表现优异,并实现了游戏战斗的50倍加速。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15411 2025-12-22 cs.RO cs.CV 90%

MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

MiVLA:迈向具有人机互模仿预训练的通用视觉-语言-动作模型

Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 MiVLA通过人机互模仿预训练,提升视觉-语言-动作模型在现实与模拟环境中的泛化能力,实验显示其在模拟和现实任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16203 2025-12-12 cs.CV cs.AI 90%

When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models

当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击

Yuping Yan, Yuhan Xie, Yixin Zhang, Lingjuan Lyu, Handing Wang, Yaochu Jin

机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) Pennsylvania State University(宾夕法尼亚州立大学) Sony Research, Sony(索尼研究实验室,索尼) Xidian University(西安电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15201 2025-11-13 cs.RO cs.AI 90%

Survey of Vision-Language-Action Models for Embodied Manipulation

Haoran Li, Yuhui Chen, Wenbo Cui, Weiheng Liu, Kai Liu, Mingcai Zhou, Zhengtao Zhang, Dongbin Zhao

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 90%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏