When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。