Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL
缩小反思差距:面向智能体强化学习的免费校准奖励
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 针对LLM智能体在环境反馈后自我评估不准确的问题,提出RefGRPO方法,通过对比反思与实际结果计算免费校准奖励并动态调整系数,同时提升反思校准和任务准确率。