机构
*
Columbia University(哥伦比亚大学)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Yale University(耶鲁大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Google(谷歌)
;
University of Virginia(弗吉尼亚大学)
专题命中
后训练与偏好优化
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
TCS Research, \ of CSE, IIT Madras India
;
Department of Computing Science, \ of Alberta Canada
;
Qatar Computing Research Institute, \ Bin Khalifa University Qatar
;
Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras India
;
TCS Research, \ of CSE, IIT Madras
;
Department of Computing Science, \ of Alberta
;
Qatar Computing Research Institute, \ Bin Khalifa University
;
Department of Data Science \& AI, Wadhwani School of Data Science \& AI, IIT Madras
How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR
在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放
Richa Verma, Balaraman Ravindran
机构
*
TCS Research Department of CSE(TCS计算机科学系研究部)
;
IIT Madras(印度理工学院马德拉斯分校)
;
Department of Data Science & AI(数据科学与人工智能系)
;
Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Shanghai AI Lab(上海人工智能实验室)
机构
*
Microsoft Research Asia(微软亚洲研究院)
;
Nanjing University(南京大学)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Wuhan University(武汉大学)
;
University of Technology Sydney(悉尼科技大学)
;
Tsinghua University(清华大学)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)