Long-form RewardBench: Evaluating Reward Models for Long-form Generation
长文奖励基准:评估长文生成的奖励模型
专题命中 长文档RAG :RAG(abstract);分类 cs.CL
AI总结 本文提出Long-form RewardBench,首个专为长文生成设计的奖励模型评估平台,通过五个子任务评估20+主流模型,揭示分类与生成模型在长文奖励建模上的差异。
Comments Accepted by AAAI2026
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
长文奖励基准:评估长文生成的奖励模型
专题命中 长文档RAG :RAG(abstract);分类 cs.CL
AI总结 本文提出Long-form RewardBench,首个专为长文生成设计的奖励模型评估平台,通过五个子任务评估20+主流模型,揭示分类与生成模型在长文奖励建模上的差异。
Comments Accepted by AAAI2026