EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化
机构 * Peking University(北京大学) ; Fudan University(复旦大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。