Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
打破失败级联:面向医学多模态推理的步骤感知强化学习
机构 * Korea University(高丽大学) ; Upstage AI ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院) ; Hanyang University College of Medicine(汉阳大学医学院) ; AIGEN Sciences
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。