Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能
机构 * Amazon(亚马逊)
专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。
Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet