机构
*
Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab)
;
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Jiao Tong University(上海交通大学)
专题命中
后训练与偏好优化
:post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构
*
Shandong University(山东大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science and Technology(香港科技大学)
;
New York University(纽约大学)
;
Xi'an Jiaotong University(西安交通大学)
;
Australian National University(澳大利亚国立大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards
通过可验证奖励的强化学习指导大语言模型进行谈判
Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Lei Lei, Yuheng Zhang, Yisong Yue, David Simchi-Levi
机构
*
Purdue University(普渡大学)
;
California Institute of Technology(加州理工学院)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Massachusetts Institute of Technology(麻省理工学院)
专题命中
后训练与偏好优化
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI