Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
用于长期代理任务的进度条件分组策略优化
机构 * Southeast University(东南大学) ; Kuaishou Technology(快手科技) ; Meituan(美团)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。