arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2603.21697 2026-04-24 cs.CR cs.AI cs.MM 89%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12710 2026-04-24 cs.LG cs.AI cs.CL 89%

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性

Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16729 2026-04-24 cs.CR cs.AI cs.CL cs.LG 88%

Intent Laundering: AI Safety Datasets Are Not What They Seem

意图洗白:AI安全数据集并非看起来那样

Shahriar Golchin, Marc Wetter

机构 * Applied Machine Learning Research(应用机器学习研究)

专题命中 越狱攻击 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了广泛使用的对抗安全数据集质量,发现其过度依赖触发线索,导致模型安全评估与真实攻击行为脱节。

Comments v2 preprint: updated with more models and a new dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16737 2026-04-24 cs.LG cs.AI cs.CL cs.CR math.OC 85%

Secure LLM Fine-Tuning via Safety-Aware Probing

通过安全感知探测实现安全的大语言模型微调

Chengcan Wu, Zhixin Zhang, Zeming Wei, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了非有害数据微调为何可能降低安全性,提出安全感知探测框架,通过对比安全信号定位安全相关方向,优化轻量级探针以引导参数更新远离有害轨迹,提升安全与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20930 2026-04-24 cs.CR cs.AI cs.LG 81%

SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs

SafeRedirect:通过任务完成重定向击败内部安全崩溃在前沿大语言模型中

Chao Pan, Yu Wu, Xin Yao

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen 518055, China(南方科技大学计算机科学与工程系,深圳518055,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) George Washington University(乔治华盛顿大学) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,香港,中国)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeRedirect,通过重定向模型任务完成驱动力来解决内部安全崩溃问题,有效降低不安全生成率,经多模型验证显示其在不同攻击类型中均表现出色。

Comments 13 pages, 4 figures, 3 tables. Code: https://github.com/fzjcdt/SafeRedirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20945 2026-04-24 cs.CR cs.LG 79%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18457 2026-04-24 cs.CV cs.LG 57%

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

VFM-VAE:视觉基础模型可以作为潜在扩散模型的良好分词器

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出VFM-VAE,利用冻结的视觉基础模型作为潜在扩散模型的分词器,通过设计新解码器提升图像重建能力,实现分词器与扩散模型的协同优化,提升训练效率与性能。

Comments Accepted at CVPR 2026. Code and models available at: https://github.com/tianciB/VFM-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏