机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Nanyang Technological University(南洋理工大学)
;
School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院)
;
Purple Mountain Laboratories(紫金山实验室)
Co-Evolution of Policy and Internal Reward for Language Agents
语言代理中策略与内部奖励的共演化
Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu Luo, Chenglin Wu, Bang Liu
机构
*
McGill University(麦吉尔大学)
;
McMaster University(麦克马斯特大学)
;
The University of Hong Kong(香港大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Peking University(北京大学)
;
University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
;
DeepWisdom(深度智慧)
;
Université de Montréal(蒙特利尔大学)
;
Mila(米拉研究所)