Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
双不确定性引导的多模态推理策略学习
机构 * Tencent Hunyuan(腾讯文汇) ; University of Maryland(马里兰大学) ; University of North Carolina(北卡罗来纳大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。