Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
被忽视的免费午餐:后训练中的进展优势用于LLM智能体
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Argonne National Laboratory(阿贡国家实验室)
AI总结 提出进展优势概念,利用强化学习后训练中的隐式优势函数作为无标注、领域无关的步骤级评分,在测试时扩展、不确定性量化和失败归因中超越专用奖励模型。