Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning
知识图谱是隐式奖励模型:路径衍生信号促进组合推理
机构 * Department of Electrical and Computer Engineering, Princeton University, New Jersey, USA(电气与计算机工程系,普林斯顿大学,新泽西州,美国)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用知识图谱作为隐式奖励模型,通过路径衍生信号提升模型在复杂推理任务中的组合推理能力。