arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2603.20122 2026-03-23 cs.CR cs.AI 77%

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

进化式越狱:针对大语言模型的自动化多目标长尾攻击

Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

机构 * School of Artificial Intelligence(人工智能学院) Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) Department of Computer Science and Engineering(计算机科学与工程系) Southern University of Science and Technology(南方科技大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19247 2026-03-23 cs.CL cs.AI 62%

When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models

当提示优化成为劫持:大型语言模型的自适应红队测试

Zafir Shamsi, Nikhil Chekuru, Zachary Guzman, Shivank Garg

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在对抗性提示优化下的安全性漏洞,通过自适应红队测试发现开源小模型的安全保障显著降低,表明静态评估无法准确反映真实风险。

Comments EACL SRW 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14332 2026-03-23 cs.CR 50%

Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use

动态能力治理:用于AI代理工具使用的加密绑定与可重复性验证

Ziling Zhou

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出三种代理治理要求,通过加密绑定和可重复性验证解决AI代理动态能力验证问题,证明两个结构定理并验证两种加密方案,展示低开销和高安全性。

Comments 23 pages, 5 figures, 18 tables. Includes 11 experiments, 9 formal security properties, and appendix with proofs

详情

展开后加载摘要…

URL PDF HTML 收藏