arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9754 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9088 篇

2604.11572 2026-04-14 cs.RO cs.MM 88%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04161 2026-04-13 cs.RO 88%

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

推理时的自适应动作分块

Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

机构 * National University of Singapore(新加坡国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Sangfor Technologies Inc.(深信服科技股份有限公司) Mininglamp Technology(明略科技) Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出自适应动作分块策略,通过动作熵动态调整分块大小,提升机器人操作的反应与一致性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25044 2026-04-10 cs.RO 88%

ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making

ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型

Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。

Comments 2026 RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23202 2026-04-08 cs.CV 88%

Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的目光正则化

Anupam Pani, Yanchao Yang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出一种目光正则化框架,通过将目光热图转换为补丁分布,并利用KL散度正则化Transformer注意力,提升机器人操作任务的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 88%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 88%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20309 2026-04-08 cs.LG 88%

QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

QuantVLA: 用于视觉-语言-动作模型的可扩展后训练量化

Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan, Haokun Lin, Xin Wang, Ziqi Wang, Yingtie Lei, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.LG

AI总结 QuantVLA是一种无需训练的后训练量化框架,首次应用于视觉-语言-动作系统,并成功量化了扩散变换器(DiT)动作头,通过三种可扩展组件实现了高效的低比特量化,显著提升任务成功率并降低内存消耗。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28740 2026-03-31 cs.RO 88%

FocusVLA: Focused Visual Utilization for Vision-Language-Action Models

FocusVLA: 用于视觉-语言-动作模型的聚焦视觉利用

Yichi Zhang, Weihao Yuan, Yizhuo Zhang, Xidong Zhang, Jia Wan

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) DaiMon Robotics, China(戴蒙机器人公司) Nanjing University, Nanjing, China(南京大学) Renmin University of China, Beijing, China(中国人民大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出FocusVLA,通过聚焦任务相关视觉区域提升视觉-语言-动作模型的性能,解决视觉信息利用不足的问题。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL 88%

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22201 2026-03-26 cs.RO 88%

ACG: Action Coherence Guidance for Flow-based Vision-Language-Action models

ACG:基于流的视觉-语言-动作模型中的动作一致性指导

Minho Park, Kinam Kim, Junha Hyung, Hyojin Jang, Hoiyeong Jin, Jooyeol Yun, Hojoon Lee, Jaegul Choo

机构 * DAVIAN-Robotics, KAIST AI(DAVIAN机器人实验室,韩国科学技术院人工智能研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出ACG算法,通过测试时指导提升视觉-语言-动作模型的动作一致性,从而在多种操作任务中提高成功率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01834 2026-03-24 cs.RO 88%

Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models

基于概念的词典学习用于推理时的安全性在视觉语言动作模型中

Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang

机构 * Beijing Jiaotong University(北京交通大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) University of Auckland(奥克兰大学) RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出基于概念的词典学习框架,用于提升视觉语言动作模型推理时的安全性,通过学习稀疏可解释词典识别有害概念方向并抑制风险组件,实验表明其在多个基准上有效降低攻击成功率70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 88%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17850 2026-03-19 cs.RO 88%

ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models

ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型

Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国) School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 ProbeFlow通过动态调度积分步骤减少冗余网络计算,提升动作解码效率和系统延迟,保持动作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16218 2026-03-18 cs.RO 88%

Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward

通过时间离散和时间连续速度前馈实现视觉-语言-动作模型中的动态跟踪

Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

机构 * Siemens Foundational Technologies(西门子基础技术) Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出两种方法提取VLAs中的速度目标,通过有限差分和连续三次B样条空间,改进VLA策略以解决合规性与响应性之间的权衡,提升任务执行速度和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 88%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO 88%

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11080 2026-03-13 cs.RO 88%

SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly

SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解

Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO

AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 88%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.CV

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10469 2026-03-12 cs.RO 88%

DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference

DepthCache: 一种基于深度的无训练视觉标记融合方法,用于视觉-语言-动作模型推理

Yuquan Li, Lianjie Ma, Han Ding, Lijun Zhu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 DepthCache通过利用深度作为结构先验,实现无训练的视觉标记融合,提升视觉-语言-动作模型推理速度,同时保持较高的任务成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26251 2026-03-12 cs.CV 88%

Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models

感知空间与运动:通过几何和动态意识增强潜在动作以提升视觉-语言-动作模型

Zhejia Cai, Yandan Yang, Xinyuan Chang, Shiyi Liang, Ronghan Chen, Feng Xiong, Mu Xu, Ruqi Huang

专题命中 VLA模型 :action model(title,abstract);vision-language-action(title);VLA(abstract);分类 cs.CV

AI总结 本文提出Farsighted-LAM和SSM-VLA框架,通过几何和动态意识增强视觉-语言-动作模型,提升动作建模的鲁棒性和可解释性。

Comments 8 pages, correct errors, clarify details

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 88%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21243 2026-03-10 cs.RO 88%

RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models

RetoVLA: 通过重用寄存器令牌在视觉-语言-动作模型中实现空间推理

Jiyeon Koo, Taewan Cho, Hyunjoon Kang, Eunseom Pyo, Tae Gyun Oh, Taeryang Kim, Andrew Jaeyong Choi

机构 * School of Computing, Gachon University(高丽大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 RetoVLA通过重用注册令牌提升视觉-语言-动作模型的空间推理能力,实验显示在7自由度机械臂任务中平均成功率提升17.1%。

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11917 2026-03-03 cs.RO 88%

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

OneTwoVLA:一种具有自适应推理能力的统一视觉-语言-动作模型

Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 OneTwoVLA通过自适应推理机制实现视觉-语言-动作统一,提升机器人在复杂任务中的规划、交互与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO 88%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22663 2026-02-27 cs.RO 88%

Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline

重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线

Wenxuan Song, Jiayi Chen, Xiaoquan Sun, Huashuo Lei, Yikai Qin, Wei Zhao, Pengxiang Ding, Han Zhao, Tongxin Wang, Pengxu Hou, Zhide Zhong, Haodong Yan, Donglin Wang, Jun Ma, Haoang Li

机构 * OpenHelix-Team(OpenHelix团队)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 88%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-02-17 cs.LG 88%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08440 2026-02-16 cs.RO 88%

SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios

SteerVLA:在长尾驾驶场景中引导视觉-语言-动作模型

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, Chelsea Finn

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Microsoft(微软公司)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 SteerVLA通过结合视觉-语言模型的推理能力,生成细粒度语言指令以提升驾驶策略的稳健性和长尾场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO 88%

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04228 2026-02-05 cs.RO 88%

Reshaping Action Error Distributions for Reliable Vision-Language-Action Models

重塑动作误差分布以实现可靠的视觉-语言-动作模型

Shuanghao Bai, Dakai Wang, Cheng Chi, Wanqi Zhou, Jing Lyu, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Lei Xing, Shanghang Zhang, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation(自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence(人工智能学院) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本研究通过重塑动作误差分布,提出基于最小误差熵的VLA模型训练方法,提升模型在不同任务中的成功率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏