VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
VerifyBench: 大型语言模型参考式奖励系统的基准测试
机构 * Zhejiang University(浙江大学) ; Meituan Group(美团集团) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。
Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench