From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP
从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异
Shanshan Xu, Santosh T. Y. S. S, Barbara Plank
机构
*
Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系)
;
Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院)
;
Amazon(亚马逊)
;
LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))
专题命中
后训练与偏好优化
:post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Alibaba Group(阿里巴巴集团)
;
The Chinese University of Hong Kong(香港中文大学)
;
Nanjing University of Science and Technology(南京理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Huawei Technologies Ltd.(华为技术有限公司)
;
National University of Singapore(新加坡国立大学)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
后训练与偏好优化
:LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
University of Science and Technology of China(中国科学技术大学)
;
Arizona State University(亚利桑那州立大学)
;
Honda Research Institute, USA(本田美国研究所)
专题命中
后训练与偏好优化
:post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
Huawei Foundation Model Department(华为基础模型部门)
;
The Chinese University of Hong Kong(香港中文大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中
后训练与偏好优化
:language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization
通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行
Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You
机构
*
School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国)
;
College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Mitigating Mismatch within Reference-based Preference Optimization
缓解基于参考的偏好优化中的不匹配
Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu
机构
*
Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学)
;
CFAR, A*STAR(CFAR,A*STAR)
;
CSIRO, Data61(CSIRO,Data61)
;
Southeast University(东南大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee
机构
*
School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)
;
Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系)
;
School of Intelligence Science(智能科学学院)
;
Technology, Nanjing University, China(技术学院,南京大学,中国)
专题命中
后训练与偏好优化
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
超越英语的校准:为更好的量化多语言大语言模型的语言多样性
Everlyn Asiko Chimoto, Mostafa Elhoushi, Bruce A. Bassett
机构
*
Lelapa AI
;
Cerebras Systems, Inc
;
University of the Witwatersrand(乌得勒支大学)
;
University of Cape Town(开普敦大学)
;
South African Astronomical Observatory(南非天文台)
专题命中
后训练与偏好优化
:LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator
你的预训练大语言模型实际上是一个未监督的置信度校准器
Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei
机构
*
Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学)
;
Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)
专题命中
后训练与偏好优化
:LLM(title);large language model(abstract);language model(abstract);post-training(abstract)