GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert
GAE: 利用可泛化动作专家释放VLM的物理潜力
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。