Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026