ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering
ScoutVLA:面向开放世界具身问答的无人机中心主动感知双专家VLA模型
机构 * National Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) ; GigaAI
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对无人机在室外具身问答中细粒度视角调整不足的问题,提出ScoutVLA模型,采用解耦双专家架构(视觉语言专家推断语义意图,动作专家生成连续视角调整轨迹),并通过知识隔离机制平衡连续控制与语义推理,在仿真和真实实验中显著优于基线方法。