Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
分支策略优化:沙盒原生语言智能体强化学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; McGill Univeristy(麦吉尔大学) ; City University of Hong Kong(香港城市大学)
专题命中 后训练与偏好优化 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。
Comments Accepted by WAIC Academic 2026