MMSkills: Towards Multimodal Skills for General Visual Agents
MMSkills: 面向通用视觉智能体的多模态技能
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc.(小红书公司) ; Southeast University(东南大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 提出MMSkills框架,通过将多模态程序知识编码为紧凑的状态条件包(包含文本程序、运行时状态卡和多视角关键帧),并利用轨迹到技能生成器和分支加载多模态技能智能体,显著提升GUI和游戏场景下视觉智能体的决策能力。
Comments 25 pages, 8 figures, 8 tables. Project page: https://zkangning.github.io/MMSkills_for_Visual_Agents/