Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
弥合SFT与RL:面向鲁棒推理的动态策略优化
Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部)
;
Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)
专题命中
指令微调
:SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
机构
*
SKLP, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所智能计算机研究中心)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Beijing Institute of Technology(北京理工大学)
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)
;
Central Research Institute, Huawei(华为中央研究院)