Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
增强证据的策略优化用于长上下文推理
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。