OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
OpenReward: 通过强化学习学习奖励长形式智能体任务
机构 * Leiden University(莱顿大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。