DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模
机构 * Tencent Hunyuan(腾讯文元) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。