Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
Skill-RM: 通过智能体技能统一异构评估标准
机构 * Qwen Large Model Application Team, Alibaba(通义千问大模型应用团队,阿里巴巴) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; ETH Zürich University of Zurich(苏黎世联邦理工学院)
AI总结 提出Skill-RM框架,将奖励建模重构为可重用的奖励评估技能执行,通过动态选择和聚合证据统一异构评估标准,在奖励基准和下游任务中优于传统方法。