A Descriptive and Normative Theory of Human Beliefs in RLHF
基于人类反馈强化学习中的人类信念描述性与规范性理论
Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum
机构
*
College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校)
;
Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)
机构
*
University of Arizona, USA(亚利桑那大学)
;
Arizona State University, USA(亚利桑那州立大学)
;
Now at Google LLC, work done at Rice University(现就职于谷歌公司,曾就职于里士大学)
;
Clemson University, USA(克莱姆森大学)
;
Washington University in St. Louis, USA(圣路易斯华盛顿大学)
;
Halmstad University, Sweden(哈姆斯塔德大学)
;
Guangdong Institute of Intelligence Science and Technology, China(广东智能科学与技术研究院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)
机构
*
Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系)
;
Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心)
;
Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)
专题命中
后训练与偏好优化
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation
TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成
Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad
机构
*
Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)
专题命中
后训练与偏好优化
:SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
机构
*
UCL Department of EEE(伦敦大学学院电子工程系)
;
UCL Centre for AI(伦敦大学学院人工智能中心)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
UNIST Graduate School of AI(延世大学人工智能研究生院)
;
University of Edinburgh(爱丁堡大学)
;
University of Basel(巴塞尔大学)
专题命中
后训练与偏好优化
:LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tsinghua University(清华大学)
;
Institute of Artificial Intelligence (TeleAI)(人工智能研究所)
;
ShiFang Technology Inc.(ShiFang科技公司)
专题命中
后训练与偏好优化
:SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心)
;
School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
;
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所)
;
Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)
专题命中
后训练与偏好优化
:large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL
机构
*
Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心)
;
Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院)
;
Northeastern University(东北大学)
;
Zhejiang Gongshang University(浙江工商大学)
专题命中
后训练与偏好优化
:RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
机构
*
Vellore Institute of Technology(维洛雷理工学院)
;
University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
;
Northwestern University(西北大学)
;
Yale University(耶鲁大学)
;
Algoverse AI Research(Algoverse AI研究)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality