Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO
AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。