From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
机构 * Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; University of St Andrews(圣安德鲁大学) ; East China Normal University(华东师范大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
机构 * RespAI Lab, School of Computer Engineering, KIIT Bhubaneswar(RespAI实验室,计算机工程学院,KIIT大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
Comments Accepted to COLM 2025
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Fujian Cancer Hospital(福建癌症医院)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
机构 * University of Chicago(芝加哥大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG
Comments To appear in USENIX Security Symposium 2025. The code and data are at: https://github.com/Wang-Yanting/TracLLM
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI、cs.LG
Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
Comments Preprint, under review
机构 * University of Waterloo(滑铁卢大学) ; NVIDIA(NVIDIA公司)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted to LLMSEC 2025
机构 * Dartmouth College(达特茅斯学院)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG
Comments Accepted by Findings of ACL2025
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted to Legal and Criminological Psychology (author version)
机构 * School of Information Sciences University of Illinois at Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) ; Computer Science and Engineering HKUST(计算机科学与工程香港科技大学) ; Computer Science Department University of California, Los Angeles(计算机科学系加州大学洛杉矶分校) ; Research Scientist, Intel Labs(英特尔实验室研究员) ; School of Information Sciences University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Amazon Web Services(亚马逊网络服务)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: text overlap with arXiv:2407.14644
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
Comments Accepted to ACL 2025 Main
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG
Comments Doctoral disstertation
机构 * Nanyang Technological University(南洋理工大学) ; Northwest Normal University(西北师范大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Independent Researcher(独立研究者)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
机构 * Rice University(里士大学) ; Case Western Reserve University(凯斯西储大学) ; University of Minnesota(明尼苏达大学) ; Rutgers University(罗格斯大学) ; Texas A&M University(德克萨斯阿姆大学) ; Samsung Electronics America(三星电子美国公司)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
Comments 21 pages, 6 figures, 15 tables
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
Comments ICLR 2025
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
Comments The paper has been accepted to AAAI 2025
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
Comments Accepted at NeurIPS 2024, camera ready version. Code and data are available at https://github.com/lancopku/agent-backdoor-attacks