Co-Evolution of Policy and Internal Reward for Language Agents
语言代理中策略与内部奖励的共演化
机构 * McGill University(麦吉尔大学) ; McMaster University(麦克马斯特大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; DeepWisdom(深度智慧) ; Université de Montréal(蒙特利尔大学) ; Mila(米拉研究所)
AI总结 本文提出Self-Guide方法,通过自动生成内部奖励实现推理和训练时的协同优化,提升语言代理性能。
Comments 20 pages, 13 figures