SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)