Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
Evolving-RL: 端到端优化经验驱动的自我进化能力
机构 * Xiaohongshu Inc.(小红书公司) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。
Comments 17pages, 5 figures