Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
探究跨模态技能注入:场景、方法与超参数
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; WeChat AI, Tencent Inc., China(腾讯公司,中国) ; The University of Hong Kong(香港大学)
专题命中 图文多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。