arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2511.11301 2026-03-17 cs.AI 85%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 85%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY 84%

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 83%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23404 2026-03-17 cs.CL 83%

AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models

AJF:基于黑盒大语言模型理解能力的自适应突破框架

Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14860 2026-03-17 cs.CR cs.AI 70%

Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats

面向异质生成威胁的通用特征协同架构

Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi

机构 * University of Shanghai for Science and Technology(上海理工大学) Singapore Management University(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14278 2026-03-17 cs.CR 67%

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

激活手术:无需修改提示的白盒LLM劫持

Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出通过直接操控模型内部激活来改变生成轨迹,揭示拒绝产生的位置与机制,并抑制安全机制,探讨开放权重模型的安全影响。

Comments To appear in Proceedings of ESORICS 2026 (Springer LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏