Comments16 pages, 20 references. v2: Added brief discussion situating "honest signals" terminology in evolutionary biology (Sec. 3), with two added citations (Zahavi 1975; Maynard Smith & Harper 2003). No changes to argument or conclusions
Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca, Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Marcello Galisai, Vincenzo Suriani, Daniele Nardi
机构
*
Sapienza University of Rome Department of Computer, Control and Management Engineering(罗马大学Sapienza计算机、控制与管理工程系)
;
DEXAI – Icaro Lab(DEXAI – Icaro实验室)
;
University of Rome Tor Vergata(罗马大学Tor Vergata)
;
Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校)
CommentsAccepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics
To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack
为抵御网络攻击,我们必须教AI代理黑客
Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng
机构
*
Monash University(墨尔本大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
;
National University of Singapore(新加坡国立大学)
Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
为大型视觉-语言模型设计对抗输入使用黑盒优化
Jiwei Guan, Haibo Jin, Haohan Wang
机构
*
School of Computing, Macquarie University(麦考瑞大学计算机学院)
;
School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
Siyang Cheng, Gaotian Liu, Rui Mei, Yilin Wang, Kejia Zhang, Kaishuo Wei, Yuqi Yu, Weiping Wen, Xiaojie Wu, Junhua Liu
机构
*
iFLYTEK Security Laboratory(iFLYTEK安全实验室)
;
Anhui SparkShield Intelligent Technology Co., Ltd.(安徽SparkShield智能科技有限公司)
;
Peking University(北京大学)
;
School of Automation, University of Electronic Science and Technology of China(电子科技大学自动化学院)
;
Northwest University(西北大学)
;
University of New South Wales(新南威尔士大学)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术处置协调中心)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Brown University(布朗大学)
;
University of Michigan Ann Arbor(密歇根大学安娜堡分校)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Boise State University(博伊西州立大学)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
Zixuan Hu, Li Shen, Zhenyi Wang, Yongxian Wei, Dacheng Tao
机构
*
Nanyang Technological University(南洋理工大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
University of Central Florida(佛罗里达大学)
;
Tsinghua University(清华大学)