Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning
重放重要内容:面向高效LLM强化反学习的离策略重放
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Glasgow(格拉斯哥大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 针对LLM反学习中在线策略优化对困难样本利用不足的问题,提出ReRULE方法,通过离策略重放缓冲区存储并复用低奖励困难样本,在保持通用性的同时提升反学习效率。