Tree Search for LLM Agent Reinforcement Learning
基于树搜索的LLM代理强化学习
机构 * Xiamen University(厦门大学) ; AMAP, Alibaba Group(阿里集团AMAP实验室) ; Southern University of Science and Technology(南方科技大学)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。
Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO