When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception
当LLM学会一致错误:合成欺骗的线性表示的多模型研究
Vahideh Zolfaghari
机构
*
Algoverse AI Research
;
Medical Sciences Education Research Center, Mashhad University of Medical Sciences(马什哈德大学医学科学教育研究中心)
;
Student Research Committee, Department of Health Information Technology and Management, Medical Informatics, School of Allied Medical Sciences, Shahid Beheshti University of Medical Sciences(谢赫·贝赫什提大学医学科学学院学生研究委员会,健康信息科技与管理系,医学信息学)
TRACE: Discovering Task-Specific Parameter via Adaptation-Aware Probing for Continual Fine-Tuning
TRACE: 通过适应感知探测发现任务特定参数以实现持续微调
Xiaosong Han, Ke Chen, Xindi Dai, Di Liang, Minlong Peng, Wei Pang, Fausto Giunchiglia, Xiaoyue Feng, Yonghao Liu, Renchu Guan
机构
*
College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
College of Software, Jilin University(吉林大学软件学院)
;
Fudan University(复旦大学)
;
School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞-瓦特大学数学与计算机科学学院)
;
Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval
超越分类:面向持续多模态检索的动态适配器路由
Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert, Szymon Lukasik, Bartlomiej Twardowski
机构
*
NASK National Research Institute(NASK国家研究院)
;
IDEAS Research Institute(IDEAS研究所)
;
Warsaw University of Technology(华沙技术大学)
;
Universitat Autonoma de Barcelona(巴塞罗那自治大学)
Constrained Flow Optimization via Sequential Fine Tuning for Molecular Design
通过序列微调进行约束流优化以用于分子设计
Sven Gutjahr, Riccardo De Santi, Luca Schaufelberger, Kjell Jorner, Andreas Krause
机构
*
Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)
;
Institute of Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zurich(苏黎世联邦理工学院化学与生物工程研究所)
;
ETH AI Center(苏黎世联邦理工学院人工智能中心)
Expert Merging in Sparse Mixture of Experts with Nash Bargaining
基于纳什谈判的稀疏混合专家模型专家合并
Dung V. Nguyen, Anh T. Nguyen, Minh H. Nguyen, Luc Q. Nguyen, Shiqi Jiang, Ethan Fetaya, Linh Duy Tran, Gal Chechik, Tan M. Nguyen
机构
*
Department of Mathematics, National University of Singapore(新加坡国立大学数学系)
;
Viettel AI, Viettel Group(越南电信AI部门)
;
Faculty of Mathematics and Informatics, Hanoi University of Science and Technology(河内科学技术大学数学与信息学系)
;
Bar Ilan University, Israel(以色列巴伊兰大学)
;
AI Imaging Team, Data Solution Department, FPT Software Japan(日本FPT软件数据解决方案部门AI成像团队)
Differentially Private Preference Data Synthesis for Large Language Model Alignment
面向大语言模型对齐的差分隐私偏好数据合成
Fengyu Gao, Jing Yang
机构
*
Department of Computer Science, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学计算机科学系)
;
Department of Electrical and Computer Engineering, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学电气与计算机工程系)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)
Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders
少即是多:利用稀疏自编码器在LLM特征空间中合成多样化数据
Zhongzhi Li, Xuansheng Wu, Yijiang Li, Lijie Hu, Ninghao Liu
机构
*
Department of Computing, University of Georgia, Georgia, United States(佐治亚大学计算机系)
;
Computer Engineering, University of California San Diego, California, United States(加州大学圣地亚哥分校计算机工程系)
;
Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(Mohamed bin Zayed人工智能大学机器学习系)
;
Department of Computing, Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系)
专题命中
后训练与偏好优化
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences
联邦变分偏好对齐与Gumbel-Softmax先验用于个性化用户偏好
Jabin Koo, Hoyoung Kim, Minwoo Jang, Jungseul Ok
机构
*
Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH人工智能研究生院)
;
Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH计算机科学与工程系)
;
National AI Research Lab, Seoul, Republic of Korea(首尔国家人工智能研究实验室)
专题命中
后训练与偏好优化
:RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Nanyang Technological University(南洋理工大学)
;
University of Edinburgh(爱丁堡大学)
;
City University of Hong Kong(香港城市大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training
偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法
Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley
机构
*
Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系)
;
School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院)
;
Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
机构
*
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Huawei Heisenberg Research Center(华为海森堡研究所以)
;
University of Arizona(亚利桑那大学)
;
College of Computing(计算学院)
;
Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡)
;
MemAgents Lab(MemAgents实验室)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)