CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities
StepPO: 面向智能体强化学习的步骤对齐策略优化
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 规划决策 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.CL
AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。