Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers
条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发
Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans
机构
*
Warsaw University of Technology(华沙技术大学)
;
NASK National Research Institute(NASK国家研究院)
;
Constellation
;
Truthful AI
;
University College London(伦敦大学学院)
;
Center on Long-Term Risk(长期风险中心)
;
UC Berkeley(伯克利大学)
A Survey on LLM-based Conversational User Simulation
基于大语言模型的对话用户模拟综述
Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia, Hongjie Chen, Reuben Leura, Samyadeep Basu, Subhojyoti Mukherjee, Puneet Mathur, Nesreen Ahmed, Junda Wu, Li Li, Huixin Zhang, Ruiyi Zhang, Tong Yu, Sungchul Kim, Jiuxiang Gu, Zhengzhong Tu, Alexa Siu, Zichao Wang, David Seunghyun Yoon, Nedim Lipka, Namyong Park, Zihao Lin, Trung Bui, Yue Zhao, Tyler Derr, Ryan A. Rossi
机构
*
Vanderbilt University(范德比大学)
;
Adobe Research(Adobe研究)
;
Yale University(耶鲁大学)
;
University of Oregon(俄勒冈大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Dolby Laboratories(Dolby实验室)
;
University of California, Berkeley(加州大学伯克利分校)
;
Cisco AI Research(思科人工智能研究)
;
University of Southern California(南加州大学)
;
Texas A&M University(德克萨斯阿姆斯特朗大学)
;
UC Davis(加州大学戴维斯分校)