Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
用于机器人操作的视觉-语言-动作模型中的双潜记忆
机构 * Nanjing University of Science and Technology(南京理工大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。
Comments Project page: https://github.com/quhongyu/LaMem-VLA