LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
LongTraceRL: 基于评分奖励从搜索智能体轨迹中学习长上下文推理
机构 * Tsinghua University(清华大学)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出LongTraceRL框架,通过知识图谱随机游走生成多跳问题并利用搜索智能体轨迹构建分层干扰物,结合基于实体链的评分奖励进行过程监督,提升大语言模型在长上下文推理中的表现。