RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播
Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao, Ka Ho Li, Dahai Yu, Michael Kwok-Po Ng
机构
*
TMLR Group(TMLR小组)
;
Hong Kong Baptist University(香港 Baptist大学)
;
TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司)
;
Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学)
;
Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)
Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design
将设计技能学习为记忆策略用于智能光子逆向设计
Shengchao Chen, Ting Shu, Sufen Ren
机构
*
AAII, University of Technology Sydney(AAII,悉尼技术大学)
;
School of Artificial Intelligence, Shenzhen University(人工智能学院,深圳大学)
;
School of Information and Communication Engineering, Hainan University(信息与通信工程学院,海南大学)
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents
Skill-Pro: 通过非参数PPO从经验中学习可复用技能以用于LLM智能体
Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang
机构
*
Key Laboratory of Interdisciplinary Research of Computation and Economics(交叉计算与经济学交叉研究实验室)
;
Shanghai University of Finance and Economics(上海财经大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能研究所)
;
University of Bristol(布里斯托大学)
;
Peking University(北京大学)
;
University College London(伦敦大学学院)