Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Hawaii at Mānoa(夏威夷大学马诺阿分校)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL
机构 * Pivotal Research(Pivotal研究机构) ; Stanford University(斯坦福大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI
Comments Abstract submitted to the Technical AI Governance Forum 2025 (https://www.techgov.ai/)
机构 * eBRAIN Lab, New York University Abu Dhabi (NYUAD), UAE(eBRAIN实验室,纽约大学阿布扎赫尔分校(NYUAD),阿联酋) ; AI and Digital Science Research Center, Technology Innovation Institute (TII), Abu Dhabi, UAE(人工智能与数字科学研究中心,技术创新研究所(TII),阿布扎赫尔,阿联酋)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
Comments 8 pages, 8 figures, 1 table
机构 * Department of Electrical Engineering(电气工程系) ; Indian Institute of Technology Delhi(印度理工学院德里)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL
机构 * Centre for Sustainable Development, University of Newcastle (Australia), Singapore(可持续发展中心,新南威尔士大学(澳大利亚),新加坡)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments 8 Pages, 1 figure
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
机构 * Networked Systems Security (NSS) Group\ Royal Institute of Technology Stockholm Sweden ; Networked Systems Security (NSS) Group\ Royal Institute of Technology
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments Author's version; Accepted for presentation at the ACM Workshop on Wireless Security and Machine Learning (WiseML 2025)
机构 * Purdue University(普渡大学) ; Columbia University(哥伦比亚大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
机构 * SAIL Lab, University of New Haven, West Haven, CT, USA(SAIL实验室,新罕布什尔大学,西哈文,康涅狄格州,美国)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG
Comments 23 pages, 5 figures
机构 * princeton(普林斯顿大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
Comments 10 pages, 6 figures
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Independent Researcher(独立研究者)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Jilin University(吉林大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG
机构 * AIRI ; MSU(莫斯科国立大学) ; HSE University(俄罗斯高等经济大学) ; Skoltech(斯克里普钦科技大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
Comments Added benchmarks, baselines, author, appendix
机构 * Dept. of Software and Information Systems Engineering(软件与信息系统工程系) ; Ben-Gurion University of the Negev(贝叶尔-加利利大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CY
Comments Submitted to CHI 2024
Journal ref Artificial Intelligence Review, 2024
机构 * Nexcepta Inc.(Nexcepta公司) ; RTX BBN Technologies
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * School of Software, Henan University(河南大学软件学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL
机构 * Coxwave ; Seoul National University(首尔国立大学) ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL
Comments Accepted by ACL 2025
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院) ; University of the National Education Commission in Kraków(克拉科夫国家教育委员会大学) ; Maria Curie-Sklodowska University in Lublin(利沃夫玛丽亚·克里沃斯卡大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
机构 * Department of Electrical and Computer Engineering, University of Minnesota(电气与计算机工程系,明尼苏达大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Department of Computer Science and Technology(计算机科学与技术系)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
机构 * MIT(麻省理工学院)
专题命中 越狱攻击 :alignment(abstract);分类 cs.LG
Comments 37 pages, 8 figures
机构 * Haize Labs(哈伊兹实验室)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments Accepted paper at ICLR 2025, 31 pages, including main paper, references, and appendix