arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2606.10366 2026-06-10 cs.RO cs.AI 新提交 91%

A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation

提升VLA评估中仿真与真实相关性的实用指南

Shuo Wang, Hanyuan Xu, Yingdong Hu, Fanqi Lin, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文系统研究仿真与真实环境在VLA策略评估中的相关性,提出统一框架来测量和提升仿真作为真实评估代理的有效性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30226 2026-06-09 cs.RO cs.AI 版本更新 91%

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

机构 * Shanghai Jiao Tong University(上海交通大学) CASIA(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) USTC(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。

Comments 24 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04708 2026-06-05 cs.RO cs.AI 91%

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

VISTA: 基于视觉和物理验证的UMI数据适配用于VLA训练

Siyuan Yang, Linzheng Guo, Ouyang Lu, Zhaxizhuoma, Daoran Zhang, Xinmiao Wang, Ting Xiao, Fangzheng Yan, Zhijun Chen, Yan Ding, Chao Yu, Chenjia Bai, Xuelong Li

机构 * Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Lumos Robotics(Lumos机器人) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Harbin Engineering University(哈尔滨工程大学) Fudan University(复旦大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出VISTA框架,通过UMI-VQA数据集对齐视觉表示、物理验证流水线筛选可行轨迹以及两阶段联合训练,解决UMI数据训练VLA模型时的视觉分布偏移和物理不可行动作问题。

Comments Corrected the typing error

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30834 2026-06-01 cs.RO cs.AI 91%

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

轨迹中的捉迷藏:发现VLA运行时监控的失败信号

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出Hide-and-Seek框架,通过轨迹间和轨迹内对比学习,从轨迹级监督中定位失败指示动作,实现无需步骤标注的VLA模型运行时失败检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30660 2026-06-01 cs.LG cs.RO 91%

BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies

BOKBO (Best of K Bad Options): VLA策略的校准式弃权

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对视觉-语言-动作(VLA)策略的测试时扩展方法,提出首个共形弃权层BOKBO,通过全局和逐任务变体提供有限样本无分布保证的执行违规率控制,并揭示基于扰动的K采样下策略内部非一致性分数的结构性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI 91%

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02037 2026-05-26 cs.RO cs.AI 91%

VILAS: A VLA-Integrated Low-cost Architecture with Soft Grasping for Robotic Manipulation

VILAS:一种集成软抓取的VLA低成本机器人操作架构

Zijian An, Hadi Khezam, Bill Cai, Ran Yang, Shijie Geng, Yiming Feng, Yue Zheng, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学) Virginia Seafood Agricultural Research and Extension Center(弗吉尼亚海鲜农业研究与推广中心) Amazon Store Foundation AI (SFAI)(亚马逊商店基金会人工智能(SFAI))

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出VILAS低成本模块化机器人操作平台,集成软抓取机构,支持端到端VLA策略学习与部署,并在葡萄抓取任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19524 2026-05-20 cs.RO cs.CV 91%

SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving

SafeAlign-VLA: 一种增强负样本的安全对齐框架用于风险感知的自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SafeAlign-VLA框架,通过整合负样本数据提升自动驾驶系统对安全边界的理解,通过生成安全标签和反事实轨迹,结合两阶段训练策略和基于锚点的群体相对策略优化,提高了自动驾驶的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16154 2026-05-18 cs.LG cs.RO 91%

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

学习结果分歧之处:通过概率块掩码实现高效的VLA强化学习

Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 本文提出概率块掩码(PCM),通过选择性分配梯度计算来提升GRPO-based VLA RL的效率,实现更快的训练速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 91%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00807 2026-05-15 cs.CV cs.RO 91%

Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds

Any3D-VLA:通过多样化点云增强VLA鲁棒性

Xianzhe Fan, Shengliang Deng, Xiaoyang Wu, Yuxiang Lu, Zhuoling Li, Mi Yan, Yujia Zhang, Zhizheng Zhang, He Wang, Hengshuang Zhao

机构 * School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, China(计算与数据科学学院,香港大学,香港特别行政区,中国) School of Computing(计算学院) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Any3D-VLA,通过整合点云与2D表示,提升VLA在复杂场景中的鲁棒性,解决3D数据稀缺和领域差距问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10426 2026-05-14 cs.CV cs.AI 91%

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 91%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01581 2026-04-28 cs.RO cs.LG 91%

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV:基于运动学的具身VLA模型的推测解码

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan), Wuhan, China(中国地质大学(武汉)计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 本文提出KERV框架,结合token域和运动学域预测,通过运动学卡尔曼滤波和动态调整策略提升VLA模型的推理速度,实验显示在多种任务中加速27%-37%且成功率损失极小。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23121 2026-04-28 cs.RO cs.CV 91%

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

打破锁定:在低数据VLA后训练中保持可引导性

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DeLock方法,通过保留视觉 grounding 和测试时对比提示指导,解决VLA策略在低数据后训练中因过度专业化导致的概念和空间锁定问题,实验证明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09244 2026-04-21 cs.MM cs.CV cs.RO 91%

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

2D或3D:谁在VLA模型中主导显著性?——具有模态显著性意识的三阶段令牌剪枝框架

Zihao Zheng, Sicheng Tian, Zhihao Mao, Lingyue Zhang, Chenyue Li, Ziyun Zhang, Hong Gao, Yuchen Huang, Yutong Xu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ZTE Corporation(中兴通讯) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出三阶段令牌剪枝框架,通过捕捉2D/3D模态显著性的差异与动态,提升VLA模型的推理效率,实验显示在最小精度损失下实现2.55倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01944 2026-04-20 cs.RO cs.CV 91%

AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving

AutoDrive-R$^2$: 促进自动驾驶VLA模型的推理与自反思能力

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Sun Yat-sen University(中山大学) University of Queensland(昆士兰大学) Lanzhou University(兰州大学) Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出AutoDrive-R$^2$框架,通过链式推理和强化学习提升自动驾驶VLA系统的推理与自反思能力,使用nuScenesR$^2$-6K数据集和GRPO算法实现高鲁棒性轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14178 2026-04-17 cs.RO cs.AI 91%

Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion

迈向无需微调的VLA部署:通过具身进化扩散实现即插即用的推理时VLA策略引导

Zhuo Li, Junjia Liu, Zhipeng Dong, Tao Teng, Quentin Rouxel, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong(协作与多功能机器人实验室,T-Stone机器人研究所,香港中文大学,香港) Φ \Phi -Institute for Physical Human Intelligence(物理人机智能研究所) Center for Embodied Artificial Intelligence and Computer Vision, Shenzhen Loop Area Institute, Shenzhen, China(具身人工智能与计算机视觉中心,深圳环园研究院,深圳,中国) Department of Advanced Robotics, Istituto Italiano di Tecnologia, Genoa, Italy(先进机器人系,意大利理工学院,热那亚,意大利)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出VLA-Pilot方法,通过即插即用的策略引导实现无需微调的零样本部署,提升预训练VLA在不同任务和机器人平台上的表现。

Comments 9 pages, 8 figures, submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09824 2026-04-14 cs.RO cs.CL cs.CV 91%

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

ProGAL-VLA: 通过前瞻性推理实现视觉-语言-动作模型中的 grounded 对齐

Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);action model(title);vision language action(abstract)

AI总结 ProGAL-VLA 通过构建 3D 实体中心图、使用慢速规划器生成符号子目标,并通过 Grounding Alignment Contrastive 损失对齐实体,提升机器人在扰动下的鲁棒性,减少语言忽略并提高实体检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02241 2026-04-13 cs.CV cs.RO 91%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05323 2026-04-08 cs.CV cs.RO 91%

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

VLA-InfoEntropy:一种无需训练的视觉-注意力信息熵方法,用于视觉-语言-动作模型的推理加速与成功

Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出VLA-InfoEntropy方法,通过图像熵和注意力熵结合时间步信息,动态调整模型关注区域,减少冗余并提升推理效率。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25766 2026-03-30 cs.RO cs.AI 91%

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 91%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22280 2026-03-24 cs.CV cs.RO 91%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV 91%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18953 2026-03-17 cs.RO cs.AI 91%

Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations

Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性

Hanqing Liu, Shouwei Ruan, Jiahuan Long, Junqi Wu, Jiacheng Hou, Huili Tang, Tingsong Jiang, Weien Zhou, Wen Yao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07904 2026-03-17 cs.LG cs.RO 91%

DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models

DyQ-VLA: 时序动态感知的视觉-语言-动作模型量化

Zihao Zheng, Hangyu Cao, Sicheng Tian, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 本文提出DyQ-VLA,通过动态量化框架解决视觉-语言-动作模型在时序动态敏感性和实时分配上的问题,实现内存占用降低30.9%且性能保持99.5%,在仿真和现实场景中分别获得1.49倍和1.43倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02310 2026-02-26 cs.RO cs.CV 91%

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

PD-VLA:通过并行解码加速集成动作分块的视觉-语言-动作模型

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Han Zhao, Wei Zhao, Zhide Zhong, Zongyuan Ge, Zhijun Li, Donglin Wang, Jun Ma, Lujia Wang, Haoang Li

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 PD-VLA通过并行解码框架提升视觉-语言-动作模型在动作分块中的效率与性能

Comments Accepted by IROS 2025, updated results on LIBERO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10098 2026-02-17 cs.RO cs.CV 91%

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14666 2025-12-17 cs.RO cs.CV 91%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏