Start Classifying: Categorical Critics for LLM Reinforcement Learning
开始分类:用于大语言模型强化学习的分类式评判器
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Tencent YoutuLab(腾讯优图实验室) ; Griffith University(格里菲斯大学) ; Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)
AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。
Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo