Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
揭示LLM安全对齐中的logit抑制漏洞
Yuxi Li, Yi Liu, Yuekang Li, Ling Shi, Gelei Deng, Shengquan Chen, Kailong Wang
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Nanyang Technological University(南洋理工大学)
;
University of New South Wales(新南威尔士大学)
;
Nankai University(南开大学)
Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化
Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang
机构
*
Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡)
;
School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡)
;
College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
;
DSO National Laboratories, Singapore(新加坡国防科学实验室)