arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1721 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1721 篇

2409.03274 2024-12-03 cs.CR cs.AI 57%

Recent Advances in Attack and Defense Approaches of Large Language Models

Jing Cui, Yishi Xu, Zhewei Huang, Shuchang Zhou, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07130 2024-11-27 cs.AI 57%

Harnessing LLM to Attack LLM-Guarded Text-to-Image Models

Yimo Deng, Huangxun Chen

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 10 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16527 2024-11-19 cs.CR cs.LG 57%

Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis

Jonathan Brokman, Omer Hofman, Oren Rachmil, Inderjeet Singh, Vikas Pahuja, Rathina Sabapathy Aishvariya Priya, Amit Giloni, Roman Vainshtein, Hisashi Kojima

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05056 2024-11-11 cs.CR cs.AI 57%

Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models

Pete Janowczyk, Linda Laurier, Ave Giulietta, Arlo Octavia, Meade Cleti

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01251 2024-11-11 cs.CL 57%

Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling

Yiran Zhao, Wenyue Zheng, Tianle Cai, Xuan Long Do, Kenji Kawaguchi, Anirudh Goyal, Michael Shieh

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13722 2024-10-18 cs.CR cs.AI 57%

Persistent Pre-Training Poisoning of LLMs

Yiming Zhang, Javier Rando, Ivan Evtimov, Jianfeng Chi, Eric Michael Smith, Nicholas Carlini, Florian Tramèr, Daphne Ippolito

专题命中 越狱攻击 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09043 2024-10-16 cs.CR cs.AI 57%

Transforming In-Vehicle Network Intrusion Detection: VAE-based Knowledge Distillation Meets Explainable AI

Muhammet Anil Yagiz, Pedram MohajerAnsari, Mert D. Pese, Polat Goktas

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06462 2024-10-10 cs.CR cs.AI 57%

Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders

David Noever, Forrest McKee

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04447 2024-10-08 cs.CV cs.CR cs.LG 57%

Attention Shift: Steering AI Away from Unsafe Content

Shivank Garg, Manyana Tiwari

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16997 2024-10-08 cs.CL 57%

Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective

Yujian Liu, Yang Zhang, Tommi Jaakkola, Shiyu Chang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10529 2024-08-27 cs.CV cs.AI 57%

Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors

Jiachen Sun, Changsheng Wang, Jiongxiao Wang, Yiwei Zhang, Chaowei Xiao

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03315 2024-08-21 cs.CR cs.AI 57%

Malla: Demystifying Real-world Large Language Model Integrated Malicious Services

Zilong Lin, Jian Cui, Xiaojing Liao, XiaoFeng Wang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Accepted at the 33rd USENIX Security Symposium (USENIX Security '24). The data and code are available at https://github.com/idllresearch/malicious-gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05061 2024-08-12 cs.CR cs.AI 57%

A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares

Stav Cohen, Ron Bitton, Ben Nassi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Website, see https://sites.google.com/view/promptware

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14644 2024-07-29 cs.CL 57%

Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context

Nilanjana Das, Edward Raff, Manas Gaur

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09096 2024-06-13 cs.CL 57%

Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization

Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05119 2024-06-10 cs.LG cs.CV 57%

Compositional Curvature Bounds for Deep Neural Networks

Taha Entesari, Sina Sharifi, Mahyar Fazlyab

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Proceedings of the 41 st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05141 2024-06-07 cs.CR cs.LG 57%

Transferable Availability Poisoning Attacks

Yiyong Liu, Michael Backes, Xiao Zhang

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05311 2024-06-04 cs.LG cs.CR 57%

BruSLeAttack: A Query-Efficient Score-Based Black-Box Sparse Adversarial Attack

Viet Quoc Vo, Ehsan Abbasnejad, Damith C. Ranasinghe

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2024). Code is available at https://brusliattack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02965 2024-06-03 cs.AI cs.RO 57%

Robust Collaborative Perception without External Localization and Clock Devices

Zixing Lei, Zhenyang Ni, Ruize Han, Shuo Tang, Dingju Wang, Chen Feng, Siheng Chen, Yanfeng Wang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

Comments 6pages, accepted to ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11154 2024-05-21 cs.CV cs.AI 57%

Revisiting the Robust Generalization of Adversarial Prompt Tuning

Fan Yang, Mingxuan Xia, Sangzhou Xia, Chicheng Ma, Hui Hui

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03654 2024-05-08 cs.CR cs.AI 57%

Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent

Shang Shang, Xinqiang Zhao, Zhongjiang Yao, Yepeng Yao, Liya Su, Zijing Fan, Xiaodan Zhang, Zhengwei Jiang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05314 2024-04-29 cs.CR cs.AI cs.RO 57%

SoK: On the Semantic AI Security in Autonomous Driving

Junjie Shen, Ningfei Wang, Ziwen Wan, Yunpeng Luo, Takami Sato, Zhisheng Hu, Xinyang Zhang, Shengjian Guo, Zhenyu Zhong, Kang Li, Ziming Zhao, Chunming Qiao, Qi Alfred Chen

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Project website: https://sites.google.com/view/cav-sec/pass

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13660 2024-04-23 cs.CL 57%

Trojan Detection in Large Language Models: Insights from The Trojan Detection Challenge

Narek Maloyan, Ekansh Verma, Bulat Nutfullin, Bislan Ashinov

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16211 2024-04-02 cs.CV cs.AI 57%

VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models

Zihao Zhu, Mingda Zhang, Shaokui Wei, Bingzhe Wu, Baoyuan Wu

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14965 2024-03-28 cs.CL 57%

Tricking LLMs into Disobedience: Formalizing, Analyzing, and Detecting Jailbreaks

Abhinav Rao, Sachin Vashistha, Atharva Naik, Somak Aditya, Monojit Choudhury

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments Accepted at LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10330 2024-03-18 cs.LG 57%

Towards Non-Adversarial Algorithmic Recourse

Tobias Leemann, Martin Pawelczyk, Bardh Prenkaj, Gjergji Kasneci

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15911 2024-02-27 cs.CR cs.CL 57%

PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-Rails

Neal Mangaokar, Ashish Hooda, Jihye Choi, Shreyas Chandrashekaran, Kassem Fawaz, Somesh Jha, Atul Prakash

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11082 2024-02-20 cs.CR cs.AI 57%

The AI Security Pyramid of Pain

Chris M. Ward, Josh Harguess, Julia Tao, Daniel Christman, Paul Spicer, Mike Tan

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments SPIE DCS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08767 2024-01-30 cs.CR cs.AI 57%

Masked Language Model Based Textual Adversarial Example Detection

Xiaomei Zhang, Zhaoxi Zhang, Qi Zhong, Xufei Zheng, Yanjun Zhang, Shengshan Hu, Leo Yu Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 13 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08565 2024-01-29 cs.RO cs.AI 57%

Security Considerations in AI-Robotics: A Survey of Current Methods, Challenges, and Opportunities

Subash Neupane, Shaswata Mitra, Ivan A. Fernandez, Swayamjit Saha, Sudip Mittal, Jingdao Chen, Nisha Pillai, Shahram Rahimi

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏