ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
ReMem-VLA:通过双层递归查询增强视觉-语言-动作模型的记忆能力
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; University of Freiburg(弗赖堡大学) ; Nanjing University(南京大学) ; Huawei Technologies(华为技术)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO
AI总结 ReMem-VLA通过双层递归查询机制提升视觉-语言-动作模型的记忆能力,结合帧级和块级记忆查询,增强短期和长期记忆,通过端到端训练实现上下文聚合与维护,优于现有基线模型。
Comments 14 pages, 6 figures