TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
TamperBench:系统化压力测试微调和篡改下的LLM安全性
Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla
机构
*
Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室)
;
FAR.AI Berkeley USA(伯克利美国FAR.AI公司)
;
University of Toronto Toronto Canada(多伦多大学)
;
University of Waterloo Waterloo Canada(Waterloo大学)
;
ETH Zürich Zürich Switzerland(苏黎世联邦理工学院)
;
MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室)
;
University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute)
;
Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)
Hybrid Adversarial Defence for Natural Language Understanding Tasks
混合对抗防御用于自然语言理解任务
Manar Abouzaid, Yang Wang, Chenghua Lin, Stuart E. Middleton
机构
*
School of Electronics and Computer Science, University of Southampton, UK(南安普顿大学电子与计算机科学学院)
;
Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系)
机构
*
Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学)
;
Khalifa University(卡利法大学)
;
Michigan State University(密歇根州立大学)
;
Australian National University(澳大利亚国立大学)
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Southern California(南加州大学)
;
Responsible AI Research (RAIR) Centre, The University of Adelaide(阿德莱德大学负责任人工智能研究中心)