Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
消除行动瓶颈:由令牌级能量指导的代理强化学习
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) ; Technical University of Berlin(柏林技术大学) ; University of Southern California(南加州大学) ; University of Hong Kong(香港大学) ; Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ActFocus方法,通过令牌级能量建模解决强化学习中令牌级训练信号分配不均的问题,显著提升性能。
Comments Preprint