HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents
HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体
机构 * University of Minnesota ; Northwestern University ; Amazon AGI ; Texas A\&M University ; Cisco Research
AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。
Comments ICML 2026