3SPO: State-Score-Supervised Policy Optimization for LLM Agents
3SPO: 面向LLM智能体的状态分数监督策略优化
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Fudan University(复旦大学) ; KAUST(卡塔尔人工智能研究学院) ; Fuzhou University(福州大学)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。