arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 102 篇

2607.23838 2026-07-28 cs.CR cs.AI cs.CL cs.LG 新提交 67%

TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation

TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架

Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24166 2026-06-24 cs.NE 新提交 67%

Distributed Quality-Diversity Search for Toxicity in Large Language Models

大型语言模型中毒性检测的分布式质量-多样性搜索

Onkar Shelar, Travis Desell

专题命中 越狱攻击 :safety(abstract);AI safety(abstract)

AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。

Comments 40 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15008 2026-06-16 cs.CR 新提交 67%

Security Engineering of OpenClaw: Analyzing Attack Surface Expansion and Trust-Boundary Violations

OpenClaw的安全工程:分析攻击面扩展与信任边界违反

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract)

AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11755 2026-06-11 cs.SE 新提交 67%

Acoda: Adversarial Code Obfuscation for Defending against LLM-based Analysis

Acoda:对抗性代码混淆防御基于LLM的分析

Hongzhou Rao, Zikan Dong, Yanjie Zhao, Haodong Li, Haoyu Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24014 2026-06-24 cs.AI cs.CL 新提交 66%

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

强化学习迈向广泛且持久有益的模型

Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal

机构 * OpenAI

专题命中 越狱攻击 :alignment(abstract,comments);分类 cs.CL、cs.AI

AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。

Comments Blog: https://alignment.openai.com/beneficial-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11624 2026-08-13 cs.CL cs.AI 新提交 62%

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 62%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06779 2026-08-10 q-bio.QM cs.AI cs.CL 新提交 62%

Genotypic Triggers: Exposing Pharmacogenomic Blind Spots via Host-Specific Backdoors in Generative Antimicrobial Peptide Models

基因型触发器:通过生成抗菌肽模型中宿主特定后门暴露药物基因组学盲区

Doniyorkhon Obidov, Xiaolong Guo, Yonghui Li, Kaichen Yang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基因型触发器后门攻击,操控抗菌肽生成模型使其针对特定HLA等位基因携带者生成高免疫原性风险肽,同时保留抗菌效力与低毒性,以暴露药物基因组学盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25479 2026-07-29 cs.CR cs.AI cs.LG 新提交 62%

Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

通过表示引导在视觉语言模型供应链中植入架构后门

Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24339 2026-07-28 cs.AI cs.CL 新提交 62%

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证

Dushyant Sharma

机构 * Gubernaut Research(Gubernaut研究)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。

Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18567 2026-07-22 cs.AI cs.CR cs.LG 新提交 62%

Attacking Graph Foundation Models Through Their Shared Representation

通过共享表示攻击图基础模型

Pankaj Kumar, Subhankar Mishra

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究通过攻击图基础模型的共享表示来探索其脆弱性,采用表示空间扰动和输入空间攻击等方法,针对六个公共模型进行实验,发现不同模型的脆弱性表现,如OpenGraph的频谱分词器有特定脆弱性,还分析了脆弱性与解码器读取表示的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 62%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07368 2026-07-09 cs.LG cs.AI cs.MA 新提交 62%

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

多智能体人工智能控制:分布式攻击阻碍实例级监测

Oliver Makins, Orazio Angelini, Zohreh Shams, Mary Phuong

机构 * MATS Research(MATS研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体人工智能控制中的分布式攻击,开发FakeLab代码库,评估单智能体监测应对分布式攻击的效果,发现碎片化效应,指出其与代码比例无关,受模型能力影响,还揭示显式规划器及不同强度监测的作用。

Comments Submitted to NeurIPS; 81 pages; 32 figures and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23884 2026-07-02 cs.CL cs.AI 新提交 62%

One Year Later...The Harms Persist, But So Do We!

一年后...伤害持续,但我们仍在!

Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar, Anson Antony

机构 * Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。

Comments 20 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 62%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 61%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG;trustworthy(comments)

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 57%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10405 2026-08-12 cs.SD cs.AI 新提交 57%

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

永不停止说话:针对端到端语音语言模型的拒绝服务攻击

Shuozhe Cheng, Kunlan Xiang, Mingxuan Li, Ji Zhang, Dongxiao Liu, Wenbo Jiang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本研究针对端到端语音语言模型提出基于扰动的拒绝服务攻击,通过优化声学扰动抑制EOS生成以延长解码,在三类开源模型上验证了其攻击有效性及安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04322 2026-08-06 cs.CL 新提交 57%

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出DataRx缺失感知采样方法,通过高维隐表示量化安全信号差距,仅用1% BeaverTails安全样本,即可大幅降低Llama3-8B-Instruct的攻击成功率,还可与现有安全数据合成方法结合提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 57%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11751 2026-07-14 cs.CR cs.LG cs.MA 新提交 57%

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

当局部监测器遗漏组合性危害时:诊断多智能体系统中的分布式后门

Yibo Hu, Ren Wang

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究多智能体系统中分布式后门问题及局部监测器漏洞,提出可观测性边界概念,通过实验证明局部监测器在局部无害时会失效,还展示了特定监测器和门的效果,指出找到能暴露负载的表示形式是未解决问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10630 2026-07-14 cs.RO cs.AI 新提交 57%

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

作为对手的世界模型:用于鲁棒运动规划的多智能体自我博弈微调

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究在密集交通中自动驾驶车辆鲁棒运动规划问题,提出对抗世界建模(AWM)框架,通过多智能体自我博弈微调,引入解耦求解器,经实验验证该方法能生成可转移对抗交互,使规划器在多种场景有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 57%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06807 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

当智能体行为异常时:基于激活的多智能体系统恶意行为检测

Haowen Xu, Xue Tan, Lei Ma, Zhihao Zhang, Chao Wang, Qingze Wang, Ping Chen, Jun Dai, Xiaoyan Sun

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 针对多智能体系统面临的安全挑战,提出基于激活的框架AcMAS,通过分析智能体激活空间中的推理状态检测隐蔽攻击,不依赖交互图,还能恢复受损智能体功能,在检测隐蔽攻击上显著优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06643 2026-07-09 cs.CR cs.LG 新提交 57%

The Power of Backdoor Absorption in Community Training

社区训练中后门吸收的力量

Issam Seddik, Sami Souihi, Mohamed Tamaazousti, Sara Tucci Piergiovanni

机构 * Université Paris-Saclay, CEA LIST(巴黎萨克雷大学,CEA LIST)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究在分散训练中后门攻击问题,通过量化最小审计开销,将注入-吸收动态形式化为离散时间马尔可夫链,证明结合自然吸收等策略可使对手成功概率降为零,实证显示能有效抑制后门且效用无退化,为安全关键型AI提供高效防御。

Comments Technical Report, CEA-LIST. 15 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23496 2026-06-23 cs.LG cs.CR 新提交 57%

TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization

TROPT:统一和推进离散文本优化的开放框架

Matan Ben-Tov, Mahmood Sharif

机构 * Tel Aviv University(特拉维夫大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 提出TROPT,首个统一离散优化器执行与开发的开源框架,支持30+优化方案,降低应用门槛并促进新策略研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20470 2026-06-19 cs.CR cs.AI 新提交 57%

Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems

分析针对基于模型引导的自动化攻击的防御性误导策略在智能体AI系统中的应用

Reza Soosahabi, Vivek Namsani

机构 * Application & Threat Intelligence Research Center(应用与威胁情报研究中心)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文通过概率模型分析智能体AI系统的攻击-防御场景,提出“检测-误导”策略(如CMPE)以替代传统“检测-拦截”方法,通过产生误导性响应降低攻击者成功率,并在基准测试中将攻击成功率上限降低两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15531 2026-06-17 cs.LG cs.CR 新提交 57%

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

贪婪坐标扩散:通过扩散引导实现有效且语义一致的对抗攻击

Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出贪婪坐标扩散方法,利用扩散模型引导生成语义连贯的对抗样本,在保持自然性的同时实现高攻击成功率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏