arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2603.23268 2026-03-25 cs.LG cs.AI 86%

SafeSeek: Universal Attribution of Safety Circuits in Language Models

SafeSeek: 语言模型中安全回路的通用归因

Miao Yu, Siyuan Fu, Moayad Aloqaily, Zhenhong Zhou, Safa Otoum, Xing fan, Kun Wang, Yufei Guo, Qingsong Wen

机构 * University of Science United Arab Emirates University Nanyang Technological University Zayed University Intelligent Science \& Technology Academy of CASIC

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSeek框架,通过优化识别语言模型中的完整安全回路,验证了在后门攻击和安全对齐场景中的有效性,展示了安全回路的识别与利用方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23269 2026-03-25 cs.CR cs.AI cs.LG 84%

Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs

并非所有标记都同等重要:面向LLMs的查询高效 jailbreak 模糊测试

Wenyu Chen, Xiangtao Meng, Chuanchao Zang, Li Wang, Xinyu Gao, Jianing Wang, Peng Zhan, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TriageFuzz框架,通过分析标记贡献差异,提升jailbreak攻击效率,实验显示在减少查询次数的情况下,攻击成功率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22983 2026-03-25 cs.AI cs.CR 83%

Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search

晦涩但有效的:基于生物启发搜索的古典中文 Jailbreak 提示优化

Xun Huang, Simeng Qin, Xiaoshuang Jia, Ranjie Duan, Huanqian Yan, Zhitao Zeng, Fei Yang, Yang Liu, Xiaojun Jia

机构 * Nanyang Technological University(南洋理工大学) BraneMatrix AI Nanjing University of Science and Technology(南京理工大学) Northeast University(东北大学) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团) Beihang University(北航) National University of Singapore(新加坡国立大学) Zhejiang Lab(浙江实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出 CC-BOS 框架,利用多维果蝇优化算法生成古典中文对抗提示,提升黑盒 Jailbreak 攻击效果,通过八维政策维度迭代优化,实验表明其优于现有方法。

Comments ICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10766 2026-03-25 cs.CR cs.AI cs.CV 83%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22882 2026-03-25 cs.LG cs.CV 77%

TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration

TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试

Chunxiao Li, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.LG

AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 73%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏