机构
*
New York University Tandon School of Engineering(纽约大学Tandon工程学院)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Stanford University(斯坦福大学)
;
ServiceNow Research(ServiceNow研究)
;
Mila - Quebec AI Institute(魁北克AI研究院)
;
Université de Montréal(蒙特利尔大学)
专题命中
后训练与偏好优化
:LLM(summary_cn,abstract);SLM(summary_cn,abstract);language model(abstract);small language model(abstract)
Factored Causal Representation Learning for Robust Reward Modeling in RLHF
因式分解因果表示学习用于RLHF中的鲁棒奖励建模
Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Fan Feng, Biwei Huang, Shikui Tu, Lei Xu
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Alibaba Group(阿里巴巴集团)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)
专题命中
后训练与偏好优化
:RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
机构
*
Beihang University(北京航空航天大学)
;
Tsinghua University(清华大学)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
后训练与偏好优化
:RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
基于难度的偏好数据选择:通过DPO隐式奖励差距
Xuan Qi, Rongwu Xu, Zhijing Jin
机构
*
Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学计算机科学与工程保罗·G·艾伦学校)
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根马克斯·普朗克智能系统研究所)
;
Jinesis Lab, University of Toronto & Vector Institute(多伦多大学Jinesis实验室及向量研究所)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training
通过迭代奖励引导的后训练改进表格语言模型
Yunbo Long, Tejumade Afonja, Guangya Hao, Alexandra Brintrup, Mario Fritz
机构
*
Department of Engineering, University of Cambridge(剑桥大学工程系)
;
CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(德国萨尔布吕肯信息安全中心)
;
The Alan Turing Institute, London(伦敦阿兰·图灵研究所)
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
SCOPE-RL: 稳定和定量控制强化学习后训练中的策略熵
Chen Wang, Zhaochun Li, Jionghao Bai, Hexuan Deng, Ge Lan, Yue Wang
机构
*
College of Software, Nankai University(南开大学软件学院)
;
Zhongguancun Academy(中关村学院)
;
Beijing Institute of Technology(北京理工大学)
;
Zhejiang University(浙江大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
后训练与偏好优化
:post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
机构
*
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
Shanghai University of Electric Power(上海电力大学)
;
East China Normal University(华东师范大学)
;
Guangdong University of Finance and Economics(广东财经大学)
;
Alibaba Group(阿里巴巴集团)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
机构
*
Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所)
;
Fudan University, Shanghai, China(复旦大学)
;
Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
Enhancing Table Reasoning with Deterministic Table-State Rewards
通过确定性表格状态奖励增强表格推理
Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
McGill University(麦吉尔大学)
;
Université de Montréal(蒙特利尔大学)
;
University College London(伦敦大学学院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Manitoba(曼尼托巴大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI