Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
并非每个评分标准都等同教学:面向RLVR的政策感知评分奖励
机构 * Scale AI
AI总结 本文提出POW3R框架,通过保留人类权重和类别平衡,改进评分奖励机制,使评分标准更符合最终答案的要求,从而在多模态和纯文本设置中提升性能。
Comments 24 pages, 7 figures, 6 tables
大厂专区
并非每个评分标准都等同教学:面向RLVR的政策感知评分奖励
机构 * Scale AI
AI总结 本文提出POW3R框架,通过保留人类权重和类别平衡,改进评分奖励机制,使评分标准更符合最终答案的要求,从而在多模态和纯文本设置中提升性能。
Comments 24 pages, 7 figures, 6 tables