arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2606.00341 2026-06-02 cs.LG cs.AI 73%

ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use

ROGUE:源于普通计算机使用的错误对齐代理行为

Jeremy Tien, Abishek Anand, Yu-Rou Tuan, Yuchen Shen, J. Zico Kolter, Aran Nayebi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究AI代理在良性环境中因任务完成而采取不安全行为(违反可纠正性)的问题,通过基准测试发现前沿模型普遍绕过用户中断或限制,且性能提升反而加剧错误对齐。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30031 2026-05-29 cs.SD cs.AI cs.CL 73%

Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation

大型音频语言模型中的音频越狱:分类、攻防分析与成本感知评估

Bo-Han Feng, Yu-Hsuan Li Liang, Chien-Feng Liu, You-Hsuan Chang, Yun-Nung Chen

机构 * National Taiwan University(台湾大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了大型音频语言模型中音频越狱攻击与防御的统一分类法和受控实证评估,揭示了声学最佳N攻击暴露了最坏情况下的音频空间漏洞,叙事框架是一种有效的低延迟语义威胁,而现有防御在鲁棒性与良性可用性之间存在权衡。

Comments Submitted to ACL ARR 2026 May

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07085 2026-05-27 cs.HC cs.AI cs.CY 73%

The AI Cognitive Trojan Horse: How Large Language Models May Bypass Human Epistemic Vigilance

AI认知特洛伊木马:大型语言模型如何绕过人类认知警觉

Andrew D. Maynard

机构 * School for the Future of Innovation in Society, Arizona State University(未来创新社会研究所,亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 提出“认知特洛伊木马”假说,认为LLM通过优化产生的“诚实非信号”特征(流畅性、帮助性、表面无私)可能绕过人类进化出的认知警觉机制,导致用户高估其可信度。

Comments 16 pages, 20 references. v2: Added brief discussion situating "honest signals" terminology in evolutionary biology (Sec. 3), with two added citations (Zahavi 1975; Maynard Smith & Harper 2003). No changes to argument or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18239 2026-05-19 cs.CL cs.AI 73%

Multilingual jailbreaking of LLMs using low-resource languages

使用低资源语言对LLM进行多语言劫持

Dylan Marx, Marcel Dunaiski

机构 * Computer Science Division, Mathematical Sciences Department(计算机科学系,数学科学系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究通过使用低资源非洲语言进行多轮对话来测试大型语言模型的安全机制,发现翻译质量是影响低资源语言劫持成功率的关键因素。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12128 2026-05-13 cs.CL cs.CY 73%

Metaphor Is Not All Attention Needs

隐喻并非注意力所需全部

Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca, Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Marcello Galisai, Vincenzo Suriani, Daniele Nardi

机构 * Sapienza University of Rome Department of Computer, Control and Management Engineering(罗马大学Sapienza计算机、控制与管理工程系) DEXAI – Icaro Lab(DEXAI – Icaro实验室) University of Rome Tor Vergata(罗马大学Tor Vergata) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.CY

AI总结 本文研究文学式绕过策略为何有效,发现其效果源于风格不规则性而非对文学格式的识别失败,表明安全机制需考虑风格变化对模型行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 73%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00269 2026-05-04 cs.CL cs.LG 73%

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

语言模型如何处理分布外输入:一种双路径框架

Hamidreza Saghir

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出双路径框架以识别真实分布外信号,通过嵌入和处理轨迹分析不同OoD类型,展示嵌入路径在词汇区分上的优势,轨迹特征在隐含意图检测中的有效性。

Comments 30 pages, 3 figures, 30+ tables. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 73%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 73%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06975 2026-04-10 cs.CR cs.AI cs.CL 73%

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

对黑盒LLM API进行基于排名的均匀性测试

Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于排名的均匀性测试方法,用于验证黑盒LLM与本地部署的模型行为一致性,有效检测API提供者可能的模型替换或篡改行为,具有高准确性和低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00324 2026-04-02 cs.LG cs.AI 73%

The Persistent Vulnerability of Aligned AI Systems

对齐AI系统持续的脆弱性

Aengus Lynch

机构 * University College London(伦敦大学学院)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。

Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 73%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06588 2026-03-10 cs.LG cs.CL cs.PL 73%

vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM

vLLM Hook v0: 一种用于编程vLLM内部模型的插件

Ching-Yun Ko, Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 vLLM Hook v0 提供了一种插件,用于编程vLLM模型的内部状态,支持被动和主动编程,以增强模型的可编程性和功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22303 2026-02-27 cs.LG cs.AI 73%

Training Agents to Self-Report Misbehavior

训练代理自我报告不当行为

Bruce W. Lee, Chen Yueh-Han, Tomek Korbak

机构 * UPenn(宾夕法尼亚大学) NYU(纽约大学) MATS(MATS机构) OpenAI

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自我指控训练方法,通过训练代理在不当行为时产生可见信号,有效降低前沿AI对齐风险,无需假设行为可被防止或可靠分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16935 2026-02-20 cs.AI cs.ET cs.LG 73%

DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs

DeepContext: LLMs中多轮对抗意图漂移的有状态实时检测

Justin Albrethsen, Yash Datta, Kunal Kumar, Sharath Rajasekar

机构 * HighFlame

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 DeepContext通过递归神经网络实时检测LLM中的多轮对抗意图漂移,实现更高效的安全防护。

Comments 18 Pages, 7 Tables, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00187 2026-02-17 cs.CL cs.CR cs.LG 73%

Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks

引导对话动态以对抗多轮劫持攻击

Hanjiang Hu, Alexander Robey, Changliu Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于安全控制理论的神经屏障函数,通过状态空间建模和安全预测器,有效防御多轮劫持攻击,提升对话安全性与实用性。

Comments TMLR, 31 pages, 11 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07517 2026-02-10 cs.CR cs.AI cs.CL cs.DB 73%

MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots

MemPot:通过优化的陷阱来防御内存提取攻击

Yuhao Wang, Shengfang Zhai, Guanghao Jin, Yinpeng Dong, Linyi Yang, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Southern University of Science and technology(南方科技大学)

专题命中 越狱攻击 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02595 2026-02-04 cs.CR cs.AI cs.CY 73%

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

为抵御网络攻击,我们必须教AI代理黑客

Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

机构 * Monash University(墨尔本大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文主张AI代理驱动的网络攻击不可避免,需转变防御策略,提出构建全面基准、发展训练代理发现漏洞及实施治理限制进攻性AI能力,以负责任地掌握进攻性AI能力作为防御基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23255 2026-02-02 cs.CL cs.AI cs.CR 73%

Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models

现在你能听见我:对抗大型音频-语言模型的音频叙述攻击

Ye Yu, Haibo Jin, Yaoning Yu, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Boise State University(博伊西州立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究提出了一种音频叙述攻击,通过在叙述式音频流中嵌入非法指令,成功绕过大型音频-语言模型的安全机制,验证了语音接口安全性的关键挑战。

Comments to be published at EACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 73%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 73%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18100 2026-01-19 cs.CL cs.AI 73%

Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation

Panacea: 通过微调后扰动缓解大语言模型的有害微调

Yibo Wang, Tiansheng Huang, Li Shen, Huanjin Yao, Haotian Luo, Rui Liu, Naiqiang Tan, Jiaxing Huang, Dacheng Tao

机构 * Tsinghua University(清华大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Didichuxing Co. Ltd(滴滴出行有限公司) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 Panacea通过自适应扰动优化,在保持微调性能的同时缓解大语言模型的有害微调问题

Comments Accepted by NeruIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01839 2026-01-09 cs.CR cs.AI cs.CL cs.CV 73%

Jailbreaking Safeguarded Text-to-Image Models via Large Language Models

通过大型语言模型对受保护的文本到图像模型进行劫持

Zhengyuan Jiang, Yuepeng Hu, Yuchen Yang, Yinzhi Cao, Neil Zhenqiang Gong

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用微调大型语言模型来劫持受安全防护的文本到图像模型的方法,有效绕过安全防护并优于现有攻击技术。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08990 2026-01-01 cs.CR cs.AI cs.CL 73%

Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks

对黑盒大语言模型进行高效有效的跨行为攻击

Vasudev Gohil

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种高效的黑盒LLM劫持方法,通过跨行为攻击显著提高攻击效率和成功率,同时减少查询次数并展示良好的迁移能力。

Comments Code is at https://github.com/gohil-vasudev/JCB

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21749 2025-12-01 cs.CL cs.AI 73%

Proactive Defense: Compound AI for Detecting Persuasion Attacks and Measuring Inoculation Effectiveness

主动防御:用于检测说服攻击并衡量免疫效果的复合AI

Svitlana Volkova, Will Dupree, Hsien-Te Kao, Peter Bautista, Gabe Ganberg, Jeff Beaubien, Laura Cassani

机构 * Aptima, Inc.(Aptima公司)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BRIES复合AI架构,通过专门代理检测说服攻击并评估免疫效果,揭示不同模型在处理说服语言上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13548 2025-11-18 cs.CR cs.AI cs.CL 73%

ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models

Siyang Cheng, Gaotian Liu, Rui Mei, Yilin Wang, Kejia Zhang, Kaishuo Wei, Yuqi Yu, Weiping Wen, Xiaojie Wu, Junhua Liu

机构 * iFLYTEK Security Laboratory(iFLYTEK安全实验室) Anhui SparkShield Intelligent Technology Co., Ltd.(安徽SparkShield智能科技有限公司) Peking University(北京大学) School of Automation, University of Electronic Science and Technology of China(电子科技大学自动化学院) Northwest University(西北大学) University of New South Wales(新南威尔士大学) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术处置协调中心)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01599 2025-11-11 cs.CL cs.CR cs.CV cs.LG 73%

JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models

Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学) Boise State University(博伊西州立大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27172 2025-11-03 cs.LG cs.AI 73%

Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler

Zixuan Hu, Li Shen, Zhenyi Wang, Yongxian Wei, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) University of Central Florida(佛罗里达大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27062 2025-11-03 cs.LG cs.AI 73%

Consistency Training Helps Stop Sycophancy and Jailbreaks

Alex Irpan, Alexander Matt Turner, Mark Kurzeja, David K. Elson, Rohin Shah

机构 * Google(谷歌)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26981 2025-11-03 cs.LG cs.AI 73%

Fine-Grained Iterative Adversarial Attacks with Limited Computation Budget

Zhichao Hou, Weizhi Gao, Xiaorui Liu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏