Co-Evolving LLM Evaluators and Policies via DynamicRubric
通过动态评分标准共同进化大语言模型评估器和策略
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。
Comments add online model info (approved)