RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播
机构 * TMLR Group(TMLR小组) ; Hong Kong Baptist University(香港 Baptist大学) ; TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司) ; Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学) ; Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RewardFlow方法,通过构建状态图进行拓扑感知的奖励传播,为智能体推理提供无标注的密集奖励,显著提升强化学习性能。