Le Critique: Privileged Value Functions for LLM Reinforcement Learning
Le Critique:用于大语言模型强化学习的特权值函数
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。