Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
基于枢轴驱动重采样的LLM强化学习深度密集探索
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; City University of Hong Kong(香港城市大学) ; Baidu(百度)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型强化学习中探索效率低的问题,提出深度密集探索(DDE)策略,通过识别失败轨迹中的可恢复枢轴状态并局部密集重采样,结合双流优化目标,在数学推理基准上优于现有方法。