Reinforcement-aware Knowledge Distillation for LLM Reasoning
面向LLM推理的强化学习感知知识蒸馏
机构 * Meta ; Guo et al. ; Lin et al. ; Xu et al. ; Shao et al. ; Schulman et al. ; Xie et al.
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出RL感知蒸馏(RLAD),通过信任区域比率蒸馏(TRRD)在强化学习后训练中实现选择性模仿,解决分布不匹配和目标干扰问题,在逻辑推理和数学基准上优于现有方法。