Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning
超越策略优化:一种数据整理飞轮用于稀疏奖励长周期规划
机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; School of Computing, National University of Singapore(新加坡国立大学计算机科学学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出BPO框架,通过自改进的数据飞轮开发鲁棒推理模型,解决多轮代理规划中稀疏奖励长周期问题,实现高效推理和显著的token效率。