arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-01 至 2026-06-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2605.30883 2026-06-01 cs.CR 80%

TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking

TRACE: 任务感知的自适应自我进化代理越狱

Churui Zeng, Weiwei Qi, Kedong Xiu, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 越狱攻击 :safety(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)

AI总结 提出TRACE框架,通过任务分解、场景伪装和Q学习进化,实现LLM代理的高效越狱,在AgentHarm和AdvCUA上达到最高100%绕过率。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24535 2026-06-01 cs.CR cs.LG 70%

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24319 2026-06-01 cs.CL cs.AI 62%

Dual Mechanisms of Value Expression: Intrinsic vs. Prompted Values in Large Language Models

价值表达的双重机制:大型语言模型中的内在价值与提示价值

Jongwook Han, Jongwon Lim, Injin Kong, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过价值向量和价值神经元分析,揭示大型语言模型中内在价值表达与提示价值表达在机制上部分共享核心组件,但各自拥有独特功能,内在机制促进多样性,提示机制增强指令遵从。

Comments Accepted at ICML 2026. Project page: https://holi-lab.github.io/ValueMechanism/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31593 2026-06-01 cs.CR cs.AI 57%

Stateful Online Monitoring Catches Distributed Agent Attacks

有状态在线监控捕获分布式智能体攻击

Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对分布式智能体攻击中跨账户聚合的恶意行为难以被单上下文监控检测的问题,提出一种基于实时聚类的有状态在线监控方法,能够更早、更有效地捕获分布式攻击,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30667 2026-06-01 cs.CR cs.AI 57%

Automatically Attacking Software Reverse Engineering AI Agents

自动攻击软件逆向工程AI代理

Brian Crawford, Justin Phillips, Patrick McClure

机构 * Naval Postgraduate School(海军学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出基于遗传算法的对抗性提示生成技术(AutoDAN变体),通过注入无关字符串变量欺骗LLM驱动的反汇编与反编译系统,导致其错误分析二进制可执行文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-06-01 cs.CR 50%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 越狱攻击 :safety(abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏