CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding
CLAP:通过语言-动作基础实现从视觉语言模型到视觉语言动作模型的直接适配
机构 * Ochanomizu University(御茶水女子大学) ; University of Tokyo(东京大学) ; OMRON SINIC X Corp(欧姆龙(中国)有限公司)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);grounding(title);分类 cs.AI
AI总结 研究如何将预训练视觉语言模型直接转换为视觉语言动作模型,核心方法是提出CLAP,通过在数字动作序列前加自然语言描述来解决输出分布不匹配问题,单轮微调效果良好,还将发布多尺度紧凑VLA家族助力能力转移分析。
Comments Project website: https://omron-sinicx.github.io/clap/