2509.07430
2026-03-04
cs.LG
cs.AI
62%
The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
分歧选择:一种缓解强化学习中多样性崩溃的关键因素
Long Li, Zhijian Zhou, Jiaran Hao, Jason Klein Liu, Yanting Miao, Wei Pang, Xiaoyu Tan, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi
机构
*
Fudan University(复旦大学)
;
INFLY TECH(INFLY科技)
;
Griffith University(格里菲斯大学)
;
University of Waterloo(滑铁卢大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)
专题命中
数学推理
:reasoning(abstract);分类 cs.AI、cs.LG
AI总结
本文提出DPH-RL框架,通过利用f散度作为复习机制,解决强化学习中多样性崩溃问题,提升模型在不同领域的表现。