Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励
机构 * Renmin University of China(中国人民大学) ; University of Southern California(南加州大学) ; Zhejiang University(浙江大学) ; Xiaohongshu Inc.(小红书公司)
AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。