CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking
CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型
机构 * Autel Robotics(大疆创新科技有限公司) ; Northeast Normal University(东北师范大学) ; Southern University of Science and Technology(南方科技大学) ; Peking University(北京大学) ; University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。