UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪
机构 * Beijing Institute of Technology(北京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Sanya(三亚学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hunan University(湖南大学) ; Beihang University(北京航空航天大学) ; Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV
AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。