Decoupling the Declarative from the Procedural in Vision-Language-Action Models
在视觉-语言-动作模型中解耦声明性知识与程序性知识
机构 * University of Edinburgh(爱丁堡大学) ; UCL(伦敦大学学院) ; Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。