AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
AtlasVA: 无教师视觉技能记忆用于无需教师的VLM代理
机构 * Ant Group(蚂蚁集团) ; University of Science and Technology of China(中国科学技术大学) ; Westlake University(西湖大学) ; University of Michigan - Ann Arbor(密歇根大学-安娜堡分校) ; Sun Yat-sen University(中山大学)
专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 本研究提出AtlasVA,一种无需教师的视觉技能记忆框架,通过空间热图、视觉示例和符号文本技能三层结构,统一感知、记忆和优化,实现在无需外部LLM监督下的强化学习性能提升。