EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化
机构 * Peking University(北京大学) ; Fudan University(复旦大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。