arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 10 篇

2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 91%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16824 2026-04-21 cs.CR cs.AI 89%

SafeDream: Safety World Model for Proactive Early Jailbreak Detection

SafeDream: 用于主动早期对抗检测的安全世界模型

Bo Yan, Weikai Lin, Yada Zhu, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of Rochester(罗切斯特大学) IBM Research(IBM研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出SafeDream,一种轻量级世界模型框架,通过安全状态模型、CUSUM检测和对比想象组件,实现早期对抗检测,提升检测及时性并降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17093 2026-04-21 cs.CR 89%

HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking

HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全

Zeng Wang, Minghao Shao, Weimin Fu, Prithwish Basu Roy, Xiaolong Guo, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract)

AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16659 2026-04-21 cs.CR cs.SD 89%

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

良性微调破坏音频大语言模型的安全对齐

Jaechul Roh, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract,abstract_cn)

AI总结 研究探讨了音频大语言模型中良性微调对安全对齐的影响,发现通过嵌入空间距离筛选良性音频可降低安全风险,但不同架构和模态的微调风险存在差异,提出两种防御措施以降低安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13068 2026-04-21 cs.CR cs.AI cs.LG 88%

Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment

揭示LLM安全对齐中的logit抑制漏洞

Yuxi Li, Yi Liu, Yuekang Li, Ling Shi, Gelei Deng, Shengquan Chen, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Nankai University(南开大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SSAG方法,通过系统操控输出层logit揭示LLM安全对齐的漏洞,实验显示其在五种主流模型上以95%成功率暴露有害响应,同时减少86%的响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02356 2026-04-21 cs.CR cs.LG 86%

ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs

ASTRA:一种用于对抗大语言模型 jailbreak 的自动化框架

Xu Liu, Yan Chen, Kan Ling, Yichi Zhu, Hengrun Zhang, Guisheng Fan, Huiqun Yu

机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(东华大学信息科学与工程学院,上海,中国)

专题命中 越狱攻击 :jailbreak(title_cn,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 ASTRA 提出了一种自动化框架,通过闭环机制自动发现、检索和演化攻击策略,提升攻击策略的多样性和适应性。

Comments Acccepted by ACL 2026, 20 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17053 2026-04-21 cs.CL 84%

Jailbreaking Large Language Models with Morality Attacks

通过道德攻击 jailbreak 大型语言模型

Ying Su, Mingen Zheng, Weili Diao, Haoran Li

机构 * South China University of Technology(南方科技大学) HKUST(香港科技大学) Beihang University(北航大学)

专题命中 越狱攻击 :jailbreak(title_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 本文通过道德攻击研究大型语言模型的内部道德价值观,构建了包含10300个实例的道德数据集,提出了四种对抗攻击方法,揭示了LLM和防护模型在道德感知攻击中的关键漏洞。

Comments 27 pages, 6 figures, 18 tables. Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 73%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI 57%

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16543 2026-04-21 cs.MA cs.AI 57%

Conjunctive Prompt Attacks in Multi-Agent LLM Systems

多智能体大语言模型中的联合提示攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究多智能体系统中联合提示攻击的机制与防御,通过路由优化提升攻击成功率并降低误触发率,揭示了智能体流水线的结构性漏洞。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏