arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9747 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9082 篇

2605.30280 2026-06-02 cs.RO cs.AI cs.CL 94%

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

机构 * Qwen Team(通义实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);embodied foundation model(abstract)

AI总结 提出Qwen-VLA,一种基于DiT动作解码器的统一具身基础模型,通过大规模联合预训练和具身感知提示,将操作、导航和轨迹预测统一为动作-轨迹预测框架,实现跨任务、环境和机器人形态的泛化。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 94%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22539 2026-08-10 cs.RO cs.CV 版本更新 94%

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models

VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架

Borong Zhang, Jiahao Li, Jiachen Shen, Yuhao Zhang, Yishuai Cai, Lu Liu, Hailu Ji, Yuanpei Chen, Juntao Dai, Jiaming Ji, Yaodong Yang

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21386 2026-06-23 cs.LG cs.CV 新提交 94%

VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models

VLA-FAIL:面向微调视觉-语言-动作模型的高效任务失败检测

Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer, Gerhard Neumann

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出轻量级失败检测框架VLA-FAIL,结合最后一层马氏距离(LLMD)和动作块一致性(ACC)两种无需失败数据的检测器,实现高效且通用的任务失败检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13276 2026-05-15 cs.AI cs.RO 94%

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架

Yucheng Guo, Yongjian Guo, Zhong Guan, Wen Huang, Haoran Sun, Haodong Yue, Xiaolong Xiang, Shuai Di, Zhen Sun, Luqiao Wang, Junwu Xiong, Yicheng Gong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学) Beihang University(北航) JDT AI Infra(京东AI基础设施)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);embodied foundation model(abstract)

AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03956 2026-04-24 cs.CV cs.AI 94%

VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models

VLA-Forget:面向具身基础模型的视觉-语言-动作去学习

Ravi Ranjan, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);embodied foundation model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Forget框架,通过结合感知选择性编辑与层选择性推理去学习,提升去学习效果,保留感知特性和推理能力,减少量化恢复。

Comments 18 pages, 9 figures, Accepted to ACL-2026, KnowFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13926 2026-07-16 cs.RO 新提交 94%

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving

S平方-VLA:自动驾驶视觉-语言-动作模型中语义与空间流的解耦

Jianguo Yu, Rukang Wang, Duanfeng Chu, Chen Wang, Renju Feng, Liping Lu

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机电工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 研究针对自动驾驶中视觉语言模型生成低级控制动作的局限,提出S平方-VLA解耦语义和空间流,语义流用于意图推理,空间流保留空间特征并赋予先验,双流规划适配器融合二者,在基准测试中取得新的最先进水平,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29089 2026-06-30 cs.RO 94%

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

TAP-VLA:面向视觉语言动作模型的触觉标注提示

Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee, Youngsun Wi, Yinpei Dai, Dmitry Berenson, Nima Fazeli

机构 * Robotics Department, University of Michigan(密歇根大学机器人系) Computer Science and Engineering Department, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 VLA模型 :VLA(title,title_cn);action model(title,abstract);vision language action(title);vision-language-action(abstract)

AI总结 提出TAP-VLA框架,通过将触觉剪切场叠加到RGB图像上作为视觉增强,无需修改架构或触觉预训练,即可将触觉反馈融入VLA模型,在接触丰富任务中成功率78%,显著优于基线。

Comments 8 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31234 2026-06-01 cs.RO 94%

HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model

HARP-VLA:面向视觉-语言-动作模型的人机对齐表示学习

Xiang Zhu, Puzhen Yuan, Yichen Liu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, China(上海启智研究院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出HARP框架,通过有限配对人机演示和未配对视频,学习对齐的人机视觉与潜在动作表示,提升VLA模型预训练效果,在CALVIN和真实世界任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 94%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18960 2026-06-16 cs.LG cs.CV cs.RO 版本更新 94%

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型

Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu

机构 * LiAuto Inc.(LiAuto公司) Beijing University of Technology(北京理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。

Comments Accepted at CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14010 2026-06-15 cs.CV cs.LG cs.RO 新提交 94%

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12105 2026-06-11 cs.RO cs.CV cs.LG 新提交 94%

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

DAM-VLA: 解耦异步多模态视觉语言动作模型

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

机构 * Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT)(直觉机器人实验室,卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute of Germany(德国机器人研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 针对VLA模型同步时钟与物理交互中不同模态频率不匹配的问题,提出DAM-VLA,通过解耦各模态时间处理、维护传感器速率更新的潜在缓冲区,并利用门控交叉注意力整合高频模态,在7个真实操作任务中平均成功率提升至95.2%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08094 2026-06-09 cs.RO cs.AI cs.LG cs.SY eess.SY 新提交 94%

vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

vla.cpp:视觉-语言-动作模型的统一推理运行时

Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen, Thanh Q. Duong, Linh D. Le, Duy M. H. Nguyen, Vien A. Ngo, An T. Le

机构 * VinRobotics Center for AI Research, VinUniversity(VinUniversity 人工智能研究中心) Intelligent Autonomous Systems, TU Darmstadt(达姆施塔特工业大学智能自主系统) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学院) University of Stuttgart(斯图加特大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出vla.cpp,基于llama.cpp的便携C++推理运行时,支持多种VLA架构,在LIBERO-Object上接近SOTA性能,内存仅1.3 GiB,并实现跨硬件部署。

Comments 17 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29562 2026-05-29 cs.RO cs.AI cs.CV 94%

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

VLA-Pro:面向视觉-语言-动作模型的跨任务程序性记忆迁移

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.(上海新智具身智能技术有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出VLA-Pro框架,通过存储和检索任务相关的LoRA适配器作为程序性记忆,实现跨任务泛化,在仿真和真实任务中成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22896 2026-05-25 cs.RO cs.AI cs.LG 94%

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models

Agentic-VLA:视觉-语言-动作模型的高效在线自适应

Ruofan Jin, Zaixi Zhang

机构 * Ruofan Jin(金鲁凡) Zaixi Zhang(张在西)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Agentic-VLA框架,通过自适应奖励合成、语言引导探索和经验记忆三大创新,实现VLA模型在线高效自适应,在LIBERO基准上长时域任务提升12.3%,单样本学习提升28.5%,并实现零演示跨任务迁移。

Comments Total 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新 94%

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交 94%

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.CV、cs.AI

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30113 2026-06-30 cs.RO cs.AI 94%

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Hong Kong Polytechnic University(香港理工大学) Xi’an University of Electronic Science and Technology(西安电子科技大学)

专题命中 VLA模型 :VLA(title,title_cn);action model(title,abstract);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 94%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27872 2026-06-29 cs.RO cs.AI 新提交 94%

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25800 2026-06-25 cs.LG cs.RO 新提交 94%

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

ROAD-VLA:通过自蒸馏实现视觉-语言-动作模型的鲁棒在线自适应

Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 针对稀疏奖励下VLA模型在线自适应困难,提出ROAD-VLA框架,通过优势引导的自蒸馏在动作空间构建近端教师,将稀疏奖励转化为密集token级监督,并在7个机器人操作环境中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24472 2026-06-24 cs.RO cs.AI 新提交 94%

G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models

G$^3$VLA:视觉-语言-动作模型的几何归纳偏置

Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

机构 * New York University Shanghai(上海纽约大学) Technical University of Denmark(丹麦技术大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 提出G$^3$VLA模块,通过射线嵌入、投影位置编码和跨视图融合为VLA模型注入相机几何先验,无需深度传感器,在多个基准和真实机器人上提升空间敏感任务性能。

Comments Submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19297 2026-06-18 cs.LG cs.RO 新提交 94%

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

VLA 甚至知道基础知识吗?衡量视觉-语言-动作模型中的常识和世界知识保留

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

机构 * CogAI Lab(CogAI实验室) FusionBrain Lab(FusionBrain实验室) IAI MSU(MSU人工智能研究所) Lomonosov MSU(Lomonosov莫斯科大学) NUST MISIS Applied AI Institute(应用人工智能研究所) HSE University(俄罗斯高等经济大学) Generalizable AI Systems(可泛化人工智能系统) ISP RAS(俄罗斯科学院信息与自动化过程研究所) MIRAI Domain-specific NLP Group(领域特定自然语言处理小组)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 提出 Act2Answer 协议,通过动作回答评估 VLA 模型的知识保留,发现模型在简单概念上表现良好,但在丰富语义类别上存在差距,且 VQA 联合训练有助于知识保留。

Comments Project page: https://tttonyalpha.github.io/act2answer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12299 2026-06-11 cs.RO cs.LG 新提交 94%

Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering

学习对你的VLA说什么:基本无害的视觉语言动作模型引导

Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 提出一个框架,通过交互式搜索语言序列改进闭环VLA任务性能,并学习一个改进头预测何时语言引导能提升性能,同时通过共形化防止有害干预。

Comments 22 pages, 14 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14836 2026-06-10 cs.CV cs.RO 版本更新 94%

QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models

QDepth-VLA:量化深度预测作为视觉-语言-动作模型的辅助监督

Yixuan Li, Yuhui Chen, Mingcai Zhou, Haoran Li, Zhengtao Zhang, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongke Huiling Robot Technology Co.(北京中科创联机器人科技有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出QDepth-VLA框架,通过辅助深度预测任务增强VLA模型的空间感知与推理能力,在仿真和真实任务中提升操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07895 2026-06-09 cs.CV cs.RO 新提交 94%

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA: 时序块扩散视觉语言动作模型

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :VLA(title,title_cn);vision language action(title);action model(title);vision-language-action(abstract)

AI总结 提出TBD-VLA框架,通过时序块扩散机制实现离散令牌VLA模型的并行动作生成,兼顾时序连贯性与推理速度,在仿真和真实任务中优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17486 2026-05-19 cs.RO cs.LG 94%

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

DyGRO-VLA: 通过动态分组残差优化实现跨任务的视觉-语言-动作模型扩展

Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

机构 * School of Data Science, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)数据科学学院) Shenzhen Loop Area Institute(深圳河套学院) Zhejiang University(浙江大学) Rutgers University-New Brunswick(罗格斯大学新布朗斯维尔回声分校) Shanghai AI Laboratory(上海人工智能实验室) Jiangxing Intelligence Technology Inc.(江行智能科技有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 本文提出DyGRO-VLA,一种通过动态分组残差优化实现跨任务视觉-语言-动作模型扩展的两阶段优化框架,旨在提升模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10126 2026-05-12 cs.RO cs.AI 94%

AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models

AR-VLA:面向视觉-语言-动作模型的真自回归动作专家

Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov, Yuanqi Yao, Sombit Dey, Giuliano Albanese, Renaud Detry, Luc Van Gool, Danda Paudel

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(库勒恩大学,机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(库勒恩大学,电气工程系,语音和图像处理研究单位)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 AR-VLA提出了一种自回归动作专家,通过长时记忆保持上下文,解决快控与慢思的频率不匹配问题,实现高效预训练和模块化集成,提升动作生成的时空一致性。

Comments RSS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09410 2026-05-12 cs.RO cs.AI 94%

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA:面向视觉-语言-动作模型的恢复驱动策略优化

Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出RePO-VLA框架,通过恢复驱动策略优化提升视觉-语言-动作模型在长时程接触丰富操作中的鲁棒性,通过恢复意识初始化、进度感知语义价值函数和价值条件细化等方法,提高对抗成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏