AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型
机构 * LiAuto Inc.(LiAuto公司) ; Beijing University of Technology(北京理工大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG
AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。
Comments Accepted at CVPR 2026 (Highlight)