Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
从可靠到表达:面向遵循评分标准的安全评判员的课程学习
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI
AI总结 提出一种结合动态评分标准和从可靠到表达的课程学习策略,训练安全评判员在多种评分标准下稳定评估,12B模型准确率达94.12-94.88%,跨标准方差仅0.76。
Comments Accepted to ICML 2026 Workshop on AIWILDS