Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL
当上下文分片到达时的多轮推理:可扩展的分片与记忆增强强化学习
机构 * The University of Melbourne(墨尔本大学) ; Google Research Australia(谷歌澳大利亚研究院)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 针对多轮对话中信息碎片化导致LLM准确率下降65%的问题,提出通过训练模型维护紧凑滚动记忆而非增长历史来缓解,并引入低成本分片流水线将单轮QA转换为多轮碎片化情节,训练的记忆增强策略显著提升多轮准确率并零样本泛化到更难任务。