机构
*
Beihang University(北京航空航天大学)
;
Tsinghua University(清华大学)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
后训练与偏好优化
:RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
机构
*
Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国)
;
Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)
;
Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国)
;
Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
机构
*
Xidian University, Xi'an, China(西安电子科技大学)
;
Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)
;
National University of Singapore,Singapore(新加坡国立大学)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.LG
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL
Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data
Deng Yixuan, Ji Xiaoqiang
机构
*
School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院)
;
Shenzhen Institute of Artificial Intelligence and Robotics for Society, China(深圳人工智能与机器人研究院)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL