Grounding Text Embeddings in Stakeholder Associations
将文本嵌入与利益相关者关联对齐
Jonathan Rystrøm, Sofie Burgos-Thorsen, Zihao Fu, Johan Irving Søltoft, Kenneth C. Enevoldsen, Chris Russell
机构
*
University of Oxford(牛津大学)
;
Institute for Wicked Problems(复杂问题研究所)
;
The Chinese University of Hong Kong(香港中文大学)
;
Danish Technical University(丹麦技术大学)
;
Aarhus University(奥胡斯大学)
Mary Chriselda Antony Oliver, Lan Jiang, Aaron Bundi Anampiu, Elaf Almahmoud, Francesco Quinzan, Umang Bhatt
机构
*
Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学)
;
Centre for Human-Inspired Artificial Intelligence, University of Cambridge(启发式人工智能中心,剑桥大学)
;
African Institute for Mathematical Sciences, South Africa(南非数学科学研究所)
;
Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
Post-training makes large language models less human-like
后训练使大型语言模型更不像人类
Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz
机构
*
Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of Tübingen(图宾根大学)
;
University of Oxford(牛津大学)
;
Stanford(斯坦福大学)
Mechanistic Interpretability of Antibody Language Models Using SAEs
使用 SAE 对抗体语言模型的机制可解释性研究
Rebonto Haque, Oliver M. Turnbull, Anisha Parsan, Nithin Parsan, John J. Yang, Anna L. Beukenhorst, Charlotte M. Deane
机构
*
Department of Statistics, University of Oxford, UK(英国牛津大学统计系)
;
Reticular, San Francisco, USA(美国旧金山Reticular公司)
;
EECS, MIT, Cambridge MA, USA(美国麻省理工学院电子工程与计算机科学系)
;
Leyden Laboratories BV, Leiden, The Netherlands(荷兰莱顿实验室)
Commentsv3: 15 pages; corrected author list and affiliations in the main text; minor text changes; updated steering results following minor code changes; conclusions and findings remain unchanged; included link to data and code in the Data Availability section