arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

2026-05-20 至 2026-05-20 共收录 1
2605.20164 2026-05-20 cs.AI

Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

并非每个评分标准都等同教学:面向RLVR的政策感知评分奖励

Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei, Daniel George, Anas Mahmoud, Jackson Lee, Bing Liu, Yunzhong He

机构 * Scale AI

AI总结 本文提出POW3R框架,通过保留人类权重和类别平衡,改进评分奖励机制,使评分标准更符合最终答案的要求,从而在多模态和纯文本设置中提升性能。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏