Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
Athena: 利用数据高效的过程奖励模型增强多模态推理
机构 * Advanced Micro Devices Inc.(先进微器件公司) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
AI总结 提出 Athena-PRM,一种多模态过程奖励模型,通过利用弱和强完成者之间的预测一致性高效生成高质量过程标签,在仅5000样本下显著提升复杂推理问题的逐步评估性能。
Comments TMLR 2026, https://openreview.net/forum?id=unWmplHccF