arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2605.29629 2026-05-29 cs.AI 83%

Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures

超越攻击成功率:LLM安全失效的时间对数可观测性

Junyoung Park, Sunghwan Park, Seongyong Ju, Jaewoo Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出时间对数可观测性(TLO)方法,通过解码过程中的合规-拒绝边际将模型-攻击条件映射到校准的二维平面,揭示攻击成功的时间模式,并基于此设计早期停止规则将成功越狱减少一半以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01473 2026-05-29 cs.CR cs.AI 83%

SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits

SelfGrader: 基于锚定令牌级对数概率的LLM越狱检测

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出SelfGrader方法,利用锚定令牌级对数概率将越狱检测转化为数值评分问题,实现低延迟、低误报率的鲁棒检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15236 2026-05-29 cs.CR cs.AI cs.LG 82%

Jailbreaking and Mitigation of Vulnerabilities in Large Language Models

大语言模型的越狱与漏洞缓解

Benji Peng, Hanxuan Chen, Keyu Chen, Qian Niu, Ziqian Bi, Ming Liu, Pohsun Feng, Tianyang Wang, Lawrence K. Q. Yan, Yizhu Wen, Yichao Zhang, Caitlyn Heqi Yin, Xinyuan Song, Riyang Bao, Jiacheng Shi

机构 * Hunan University Changsha, PRC Georgia Institute of Technology Atlanta, USA Kyoto University Kyoto, Japan Purdue University West Lafayette, USA National Taiwan Normal University Taipei, ROC University of Liverpool Suzhou, PRC Hong Kong University of Science University of Hawaii Honolulu, USA The University of Texas at Dallas Dallas, USA University of Wisconsin-Madison Madison, USA Emory University Atlanta, USA College of William \& Mary Williamsburg, USA

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。

Journal ref Eureka 1(1) (2026) 26-61

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI 81%

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 75%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30031 2026-05-29 cs.SD cs.AI cs.CL 73%

Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation

大型音频语言模型中的音频越狱:分类、攻防分析与成本感知评估

Bo-Han Feng, Yu-Hsuan Li Liang, Chien-Feng Liu, You-Hsuan Chang, Yun-Nung Chen

机构 * National Taiwan University(台湾大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了大型音频语言模型中音频越狱攻击与防御的统一分类法和受控实证评估,揭示了声学最佳N攻击暴露了最坏情况下的音频空间漏洞,叙事框架是一种有效的低延迟语义威胁,而现有防御在鲁棒性与良性可用性之间存在权衡。

Comments Submitted to ACL ARR 2026 May

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29910 2026-05-29 cs.SE cs.AI 57%

Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents

Agora: 面向生产级共识协议中自主漏洞检测的LLM智能体

Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Information and Telecommunication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与电信工程学院) Peking University(北京大学) G Labs(0G实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出Agora,一个领域感知的多智能体框架,通过假设驱动测试和LLM协作,在Raft、EPaxos、HotStuff、BullShark四个共识实现中发现15个未知协议级逻辑漏洞,而现有LLM方法未能检测到任何此类漏洞。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏