TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
TAMTRL:教师对齐的奖励重塑用于长上下文压缩中的多轮强化学习
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算先进创新中心)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对多轮强化学习中长上下文压缩的信用分配问题,TAMTRL通过教师信号对齐和自监督奖励分配提升记忆更新质量,实验显示其在多个基准测试中优于基线方法。