arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2510.26847 2025-11-03 cs.CR cs.AI cs.CL cs.IT math.IT 73%

Broken-Token: Filtering Obfuscated Prompts by Counting Characters-Per-Token

Shaked Zychlinski, Yuval Kainan

机构 * JFrog

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16947 2025-10-29 cs.LG cs.AI 73%

MixAT: Combining Continuous and Discrete Adversarial Training for LLMs

Csaba Dékány, Stefan Balauca, Robin Staab, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院) ELTE Eötvös Loránd University, Budapest, Hungary(ELTE 爱斯特霍特·洛兰德大学,布达佩斯,匈牙利)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments Published at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13763 2025-10-27 cs.AI cs.CL q-bio.NC 73%

Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations

Li Ji-An, Hua-Dong Xiong, Robert C. Wilson, Marcelo G. Mattar, Marcus K. Benna

机构 * Neurosciences Graduate Program University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) School of Psychology Georgia Tech(佐治亚理工学院心理学系) Department of Psychology New York University(纽约大学心理学系) Department of Neurobiology University of California San Diego(加州大学圣地亚哥分校神经生物学系)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17000 2025-10-21 cs.CR cs.CL cs.LG 73%

Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs

Masahiro Kaneko, Timothy Baldwin

机构 * MBZUAI Abu Dhabi, UAE(阿布扎赫德MBZUAI)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05025 2025-10-07 cs.CL cs.AI cs.CR 73%

Imperceptible Jailbreaking against Large Language Models

Kuofeng Gao, Yiming Li, Chao Du, Xin Wang, Xingjun Ma, Shu-Tao Xia, Tianyu Pang

机构 * Tsinghua University(清华大学) Sea AI Lab, Singapore(新加坡Sea AI实验室) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01494 2025-10-06 cs.LG cs.AI 73%

Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed

Isha Gupta, Rylan Schaeffer, Joshua Kazdan, Ken Ziyu Liu, Sanmi Koyejo

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford CS(斯坦福大学计算机科学系)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21634 2025-10-06 cs.CR cs.AI cs.LG cs.NI 73%

MobiLLM: An Agentic AI Framework for Closed-Loop Threat Mitigation in 6G Open RANs

Prakhar Sharma, Haohuang Wen, Vinod Yegneswaran, Ashish Gehani, Phillip Porras, Zhiqiang Lin

机构 * SRI The Ohio State University(俄亥俄州立大学)

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16530 2025-09-23 cs.CL cs.AI 73%

AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans

Wei Xie, Shuoyoucheng Ma, Zhenhua Wang, Enze Wang, Kai Chen, Xiaobing Sun, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学研究院高性能计算研究所) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/39k8f46q

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12937 2025-09-17 cs.CR cs.AI cs.CL 73%

Jailbreaking Large Language Models Through Content Concretization

Johan Wahréus, Ahmed Hussain, Panos Papadimitratos

机构 * Networked Systems Security (NSS) Group(网络系统安全组) KTH Royal Institute of Technology(皇家理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted for presentation in the Conference on Game Theory and AI for Security (GameSec) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11835 2025-09-16 cs.CL cs.AI 73%

Multilingual Collaborative Defense for Large Language Models

Hongliang Li, Jinan Xu, Gengping Cui, Changhao Guan, Fengran Mo, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输 key laboratory(北京交通大学)) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院(北京交通大学)) University of Montreal(蒙特利尔大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09288 2025-08-20 cs.CR cs.AI cs.CL 73%

Can AI Keep a Secret? Contextual Integrity Verification: A Provable Security Architecture for LLMs

Aayush Gupta

机构 * Aayush Gupta(独立研究者)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

Comments 2 figures, 3 tables; code and certification harness: https://github.com/ayushgupta4897/Contextual-Integrity-Verification ; Elite-Attack dataset: https://huggingface.co/datasets/zyushg/elite-attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06755 2025-08-12 cs.CL cs.AI 73%

Many-Turn Jailbreaking

Xianjun Yang, Liqiang Xiao, Shiyang Li, Faisal Ladhak, Hyokun Yun, Linda Ruth Petzold, Yi Xu, William Yang Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02990 2025-07-08 cs.CL cs.AI 73%

`For Argument's Sake, Show Me How to Harm Myself!': Jailbreaking LLMs in Suicide and Self-Harm Contexts

Annika M Schoene, Cansu Canca

机构 * Institute for Experiential AI(经验式人工智能研究所) Northeastern University(东北大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00523 2025-06-26 cs.CR cs.AI cs.LG 73%

Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models

Yingkai Dong, Xiangtao Meng, Ning Yu, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(山东大学网络科学与技术学院) Netflix Eyeline Studios State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(山东大学密码与数字经济安全国家重点实验室) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(山东省人工智能安全重点实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18626 2025-06-03 cs.CR cs.AI cs.CL 73%

The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs

Sergey Berezin, Reza Farahbakhsh, Noel Crespi

机构 * SAMOVAR, Télécom SudParis Institut Polytechnique de Paris(SAMOVAR,电信南巴黎高等理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted to the Main Track of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24428 2025-06-02 cs.CL cs.LG 73%

Model Unlearning via Sparse Autoencoder Subspace Guided Projections

Xu Wang, Zihao Li, Benyou Wang, Yan Hu, Difan Zou

机构 * The University of Hong Kong(香港大学) New Jersey Institute of Technology(新泽西理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09948 2025-05-30 cs.LG cs.CL cs.CR 73%

Hijacking Large Language Models via Adversarial In-Context Learning

Xiangyu Zhou, Yao Qiang, Saleh Zare Zade, Prashant Khanduri, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Oakland University(奥克兰大学)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07610 2025-05-20 cs.CL cs.AI 73%

Concept-Level Explainability for Auditing & Steering LLM Responses

Kenza Amara, Rita Sevastjanova, Mennatallah El-Assady

机构 * Department of Computer Science ETH Zurich(计算机科学系 苏黎世联邦理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 7 figures, Submission to Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01586 2025-03-18 cs.CL cs.AI 73%

Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01865 2025-03-05 cs.LG cs.AI cs.CR 73%

Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints

Junxiao Yang, Zhexin Zhang, Shiyao Cui, Hongning Wang, Minlie Huang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14529 2025-02-21 cs.CL cs.AI 73%

CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language Models

Zhenhong Zhou, Zherui Li, Jie Zhang, Yuanhe Zhang, Kun Wang, Yang Liu, Qing Guo

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06223 2025-02-07 cs.CL cs.AI 73%

On Effects of Steering Latent Representation for Large Language Model Unlearning

Dang Huu-Tien, Trung-Tin Pham, Hoang Thanh-Tung, Naoya Inoue

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted at AAAI-25 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15275 2024-12-23 cs.CR cs.AI cs.CL 73%

Fooling LLM graders into giving better grades through neural activity guided adversarial prompting

Atsushi Yamamura, Surya Ganguli

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13077 2024-10-17 cs.CR cs.AI cs.CL 73%

GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation

Govind Ramesh, Yao Dou, Wei Xu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18725 2024-10-04 cs.LG cs.CL 73%

Jailbreaking LLMs with Arabic Transliteration and Arabizi

Mansour Al Ghanim, Saleh Almohaimeed, Mengxin Zheng, Yan Solihin, Qian Lou

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17447 2024-10-02 cs.CL cs.AI 73%

FLRT: Fluent Student-Teacher Redteaming

T. Ben Thompson, Michael Sklar

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02651 2024-08-06 cs.CL cs.AI cs.CR 73%

Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?

Mohammad Bahrami Karkevandi, Nishant Vishwamitra, Peyman Najafirad

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to AI4CYBER - KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14725 2024-06-25 cs.CR cs.CL cs.LG 73%

Testing the Limits of Jailbreaking Defenses with the Purple Problem

Taeyoun Kim, Suhas Kotha, Aditi Raghunathan

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15902 2024-05-28 cs.CR cs.AI cs.CL cs.HC 73%

Hacc-Man: An Arcade Game for Jailbreaking LLMs

Matheus Valentim, Jeanette Falk, Nanna Inie

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16717 2024-02-27 cs.CL cs.AI cs.CR 73%

CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models

Huijie Lv, Xiao Wang, Yuansen Zhang, Caishuang Huang, Shihan Dou, Junjie Ye, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏