The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
大语言模型中的拒绝几何学:概念锥与表征独立性
Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger
机构
*
School of Computation, Information \& Technology
;
Munich Data Science Institute, Technical University of Munich
;
Google Research
;
Now at Google Research
LookAhead Tuning: Safer Language Models via Partial Answer Previews
LookAhead Tuning: 通过部分答案预览实现更安全的语言模型
Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Lei Liang, Zhiqiang Zhang, Jun Zhou, Bryan Hooi, Shumin Deng
机构
*
Zhejiang University(浙江大学)
;
Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
;
Ant Group(蚂蚁集团)
;
National University of Singapore(新加坡国立大学)
Rishub Tamirisa, Bhrugu Bharathi, Long Phan, Andy Zhou, Alice Gatti, Tarun Suresh, Maxwell Lin, Justin Wang, Rowan Wang, Ron Arel, Andy Zou, Dawn Song, Bo Li, Dan Hendrycks, Mantas Mazeika