2511.11301 2026-03-17 cs.AI 85% EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment EcoAlign:一种经济理性框架,用于高效LVLM对齐 Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang 专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.14219 2026-03-17 cs.CV 85% Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining 安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练 Chongxin Li, Hanzhang Wang, Lian Duan 专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract) AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。 Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.15527 2026-03-17 cs.AI cs.CY 84% Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph 对LLM对齐中的困境和冲突是否可解?一种优先图的视角 Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu 机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; New York University(纽约大学) ; National University of Singapore(新加坡国立大学) 纠错 专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.14825 2026-03-17 cs.CV cs.AI 83% Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection 双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用 Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim 机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) ; Mobilint 纠错 专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2505.23404 2026-03-17 cs.CL 83% AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models AJF:基于黑盒大语言模型理解能力的自适应突破框架 Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li 专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80% Directional Embedding Smoothing for Robust Vision Language Models 方向嵌入平滑用于鲁棒视觉语言模型 Ye Wang, Jing Liu, Toshiaki Koike-Akino 机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) 纠错 专题命中 越狱攻击 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。 Comments Accepted at ICLR 2026 Workshop on Agents in the Wild 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.14860 2026-03-17 cs.CR cs.AI 70% Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats 面向异质生成威胁的通用特征协同架构 Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi 机构 * University of Shanghai for Science and Technology(上海理工大学) ; Singapore Management University(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) 纠错 专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。 Comments 9 pages, 10 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.14278 2026-03-17 cs.CR 67% Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt 激活手术:无需修改提示的白盒LLM劫持 Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki 专题命中 越狱攻击 :safety(abstract);jailbreak(abstract) AI总结 本文提出通过直接操控模型内部激活来改变生成轨迹,揭示拒绝产生的位置与机制,并抑制安全机制,探讨开放权重模型的安全影响。 Comments To appear in Proceedings of ESORICS 2026 (Springer LNCS) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图