arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2603.20607 2026-03-24 cs.RO cs.LG 88%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19131 2026-03-20 cs.LG cs.RO 88%

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO 88%

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17524 2026-03-19 cs.RO cs.AI 88%

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

KineVLA:面向运动学感知的视觉-语言-动作模型及双层动作分解

Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KineVLA模型,通过双层动作分解实现运动学感知,提升动作执行的精度与可控性,实验表明其在运动学敏感基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13925 2026-03-17 cs.RO cs.AI 88%

SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization

SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束

Jiashun Li, Xiaoyu Shi, Hong Xie, Mingsheng Shang, Yun Lu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12193 2026-03-13 cs.RO cs.CV 88%

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16667 2026-03-13 cs.RO cs.CV 88%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 88%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21192 2026-03-11 cs.CV cs.AI 88%

When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Qixin Zhang, Bingquan Shen, Alex C. Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) CCDS, Nanyang Technological University(CCDS,南洋理工大学) DSO National Laboratories(国防科学局实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10932 2026-03-10 cs.CR cs.AI cs.RO 88%

DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

DropVLA: 对视觉-语言-动作模型的行动级后门攻击

Zonghuan Xu, Jiayu Li, Yunhan Zhao, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。

Comments 8 pages, 6 tables, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07530 2026-03-03 cs.RO cs.CV 88%

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA:用于机器人操作的1位视觉-语言-动作模型

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 BitVLA是一种用于机器人操作的1位视觉-语言-动作模型,通过模型设计和优化提升部署效率,实现内存和延迟的显著降低。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14031 2026-03-02 cs.RO cs.AI 88%

Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model

高效机器人技能学习用于建筑任务:评估分层强化学习与视觉-语言-动作VLA模型

Zhaofeng Hu, Hongrui Yu, Vaidhyanathan Chandramouli, Ci-Jyun Liang

机构 * Department of Civil Engineering, Stony Brook University(土木工程系,石溪大学) Department of Civil and Environmental Engineering, Virginia Tech(土木与环境工程系,弗吉尼亚理工大学) Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究比较了VLA模型和RL方法在建筑机器人技能学习中的效率与效果,发现VLA在泛化和少样本学习方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV 88%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision language action(title);action model(title);vision-language-action(abstract);VLA(abstract)

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 88%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18813 2026-02-24 cs.RO cs.LG 88%

Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

Habilis-β:一种快速运动且持续运行的设备端视觉-语言-动作模型

Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

机构 * Tommoro Robotics(Tommoro机器人公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 Habilis-β是一种快速运动且持续运行的设备端视觉-语言-动作模型,通过整合预训练和后训练方法,实现了在连续运行协议下的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17951 2026-02-23 cs.CV cs.AI 88%

ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models

ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型

Guoheng Sun, Tingting Du, Kaixi Feng, Chenxiang Luo, Xingguo Ding, Zheyu Shen, Ziyao Wang, Yexiao He, Ang Li

机构 * University of Maryland, College Park University of Wisconsin, Madison City University of Hong Kong St.\ Paul's School

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05342 2026-02-10 cs.RO cs.AI 88%

Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control

信息论图融合:基于视觉-语言-动作模型的政策推理与双臂机器人控制

Shunlei Li, Longsen Gao, Jin Wang, Chang Che, Xi Xiao, Jiuwen Cao, Yingbai Hu, Hamid Reza Karimi

机构 * Electrical and Computer Engineering Department, University of New Mexico, Albuquerque, United States, 87106(电气与计算机工程系,新墨西哥大学,阿尔伯克基,美国,87106) Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford, United Kingdom, OX26NN(动态机器人系统组,牛津机器人研究所,牛津大学,英国,OX26NN) Mechanical and Aerospace Engineering Department, The George Washington University, DC, United States, 22202(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区,美国,22202) Department of Computer Science, University of Alabama at Birmingham, Alabama, United States, 35294(计算机科学系,阿拉巴马大学伯明翰分校,阿拉巴马,美国,35294) The School of Computation, Information and Technology, Technical University of Munich, Germany, 85748(计算、信息与技术学院,慕尼黑技术大学,德国,85748) Department of Mechanical Engineering, Politecnico di Milano, Milan, Italy, 20156(机械工程系,米兰理工学院,米兰,意大利,20156)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 GF-VLA通过信息论图融合视觉-语言-动作模型,实现双臂机器人任务推理与执行,提升空间泛化与任务成功率。

Comments Journal accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06521 2026-02-09 cs.CV cs.RO 88%

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

DriveWorld-VLA: 基于视觉-语言-动作的统一潜在空间世界建模用于自动驾驶

Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen

机构 * School of Computer Science(计算机科学学院) Beijing Key Laboratory of Traffic Data Mining(交通数据挖掘重点实验室) Beijing Jiaotong University(北京交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 DriveWorld-VLA通过统一视觉-语言-动作与潜在空间世界建模,提升自动驾驶中的决策与前瞻性想象能力。

Comments 20 pages, 7 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03782 2026-02-04 cs.CV cs.RO 88%

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

QVLA:视觉-语言-动作模型量化中并非所有通道都平等

Yuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu, Yuming Li, Bing Li, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学) Anyverse Dynamics State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Terminal Technology Department, Alipay, Ant Group(终端技术部,蚂蚁集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 QVLA提出了一种动作导向的量化框架,通过按通道分配比特数来优化视觉-语言-动作模型的压缩,实现了更高的性能和效率。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01158 2026-02-03 cs.CV cs.RO 88%

Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs

通过恢复损坏的视觉输入来提高视觉-语言-动作模型的鲁棒性

Daniel Yezid Guarnizo Orjuela, Leonardo Scappatura, Veronica Di Gennaro, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering(电子信息与生物工程系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出CRT模块,通过对抗训练恢复损坏的视觉输入,提升VLA模型在现实环境中的鲁棒性与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00743 2026-02-03 cs.RO cs.AI 88%

SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning

SA-VLA:面向视觉-语言-动作强化学习的空间感知流匹配

Xu Pan, Zhenglin Wan, Xingrui Yu, Xianwei Zheng, Youkai Ke, Ming Sun, Rui Wang, Ziwei Wang, Ivor Tsang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 SA-VLA通过空间感知的RL适应框架,在强化学习微调中保持空间定位,提升视觉-语言-动作任务的鲁棒性和泛化能力。

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10672 2026-01-21 cs.RO cs.CV 88%

Vision Language Action Models in Robotic Manipulation: A Systematic Review

视觉语言动作模型在机器人操作中的应用:系统综述

Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud, Jan Rosell, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。

Comments submitted to annual review in control

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03734 2026-01-01 cs.RO cs.CV 88%

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

机构 * University of California, Berkeley(加州大学伯克利分校) Meta AI

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22414 2025-12-30 cs.RO cs.AI 88%

Emergence of Human to Robot Transfer in Vision-Language-Action Models

视觉-语言-动作模型中人类到机器人的转移现象出现

Simar Kareer, Karl Pertsch, James Darpinian, Judy Hoffman, Danfei Xu, Sergey Levine, Chelsea Finn, Suraj Nair

机构 * Physical Intelligence(物理智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种简单的方法,通过预训练视觉-语言-动作模型,使模型能从人类数据中学习并转移至机器人任务,从而提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15258 2025-12-22 cs.RO cs.AI 88%

VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments

VLA-AN:一种用于复杂环境空中导航的高效且机载视觉-语言-动作框架

Yuze Wu, Mo Zhu, Xingxing Li, Yuheng Du, Yuxin Fan, Wenjun Li, Zhichao Han, Xin Zhou, Fei Gao

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 VLA-AN通过高效机载框架提升无人机在复杂环境中的导航能力,实现8.3倍推理吞吐量提升和98.1%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04952 2025-12-09 cs.CV cs.RO 88%

FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization

FASTer:通过神经动作分词实现高效的自回归视觉语言动作建模

Yicheng Liu, Shiduo Zhang, Zibin Dong, Baijun Ye, Tianyuan Yuan, Xiaopeng Yu, Linqi Yin, Chenhao Lu, Junhao Shi, Luca Jiang-Tao Yu, Liangtao Zheng, Tao Jiang, Jingjing Gong, Xipeng Qiu, Hang Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Galaxea AI Tianjin University(天津大学) Hong Kong University(香港大学) UCSD(加州大学圣地亚哥分校)

专题命中 VLA模型 :vision language action(title);action model(title);vision-language-action(abstract);VLA(abstract)

AI总结 FASTer通过神经动作分词实现高效自回归视觉语言动作建模,提升机器人学习的推理效率和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV 88%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 88%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02834 2025-12-03 cs.RO cs.AI 88%

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 88%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.LG

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏