PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
PDCR:感知分解置信度奖励用于视觉-语言推理
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。
Comments CVPR 2026