Mutual-Taught for Co-adapting Policy and Reward Models
机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(计算机科学与工程学院,中山大学) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
Comments Accepted to ACL 2025 (Main Conference)