arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-10 至 2026-03-10 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2603.08234 2026-03-10 cs.AI cs.LG 86%

The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs

延续与拒绝之间的斗争:对LLMs中延续触发突破的机理分析

Yonghong Deng, Zhen Yang, Ping Jian, Xinyue Zhang, Zhongbin Guo, Chengzhi Li

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs中延续触发突破现象,揭示了模型内在延续驱动与安全防御之间的竞争机制,为提升模型安全性提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 83%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 75%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06588 2026-03-10 cs.LG cs.CL cs.PL 73%

vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM

vLLM Hook v0: 一种用于编程vLLM内部模型的插件

Ching-Yun Ko, Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 vLLM Hook v0 提供了一种插件,用于编程vLLM模型的内部状态,支持被动和主动编程,以增强模型的可编程性和功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07590 2026-03-10 cs.CV cs.LG 70%

Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints

模型作为乐高积木:通过语义蓝图从良性积木中组装恶意内容

Chenxi Li, Xianggan Liu, Dake Shen, Yaosong Du, Zhibo Yao, Hao Jiang, Linyi Jiang, Chengwei Cao, Jingzhe Zhang, RanYi Peng, Peiling Bai, Xiande Huang

机构 * DAIL Tech(DAIL科技) NLP & KG Lab, Huazhong University of Science and Technology(自然语言处理与知识图谱实验室,华中科技大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出StructAttack,通过语义蓝图将看似无害的槽类型组合成恶意内容,揭示LVLMs在视觉模态整合中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07384 2026-03-10 quant-ph 50%

Machine Learning Techniques for Enhancing Quantum Key Distribution

用于增强量子密钥分配的机器学习技术

Ali Al-Kuwari, Safaa Alqrinawi, Lujayn Al-Amir, Amina Mollazehi, Saif Al-Kuwari

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文综述了机器学习技术在提升量子密钥分配系统安全性和性能方面的应用,涵盖参数优化、攻击检测、协议选择、密钥性能预测和量子网络管理等五个方面。

详情

展开后加载摘要…

URL PDF HTML 收藏