Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
Agent^2 RL-Bench: 能否让LLM代理在训练后设计自主强化学习?
机构 * Soochow University(苏州大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Stony Brook University(石溪大学) ; The University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI
AI总结 Agent2 RL-Bench评估LLM代理在训练后自主设计、实现、调试和执行提升基础模型的管道能力,展示代理在强化学习中的智能行为与局限性。
Comments 37 pages, 7 figures, 20 tables