From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection
从SFT到RL:解开基于LLM的漏洞检测后训练流程的谜团
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Microsoft(微软)
专题命中 指令微调 :LLM(title,title_cn);SFT(title,title_cn);post-training(title,abstract);preference optimization(abstract)
AI总结 本文研究了基于LLM的漏洞检测后训练流程,发现基于GRPO的在线RL优于SFT和离线偏好优化方法,提出了数据筛选、阶段交互、奖励机制和评估协议的改进策略。