arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-11 至 2026-03-11 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2505.11790 2026-03-11 cs.LG cs.CR 85%

JULI: Jailbreak Large Language Models by Self-Introspection

通过自我反思 jailbreak 大型语言模型:JULI

Jesson Wang, Zhanhao Hu, David Wagner

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09246 2026-03-11 cs.CR 82%

Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models

面向推理的编程:通过链式语义工具来突破大型视觉语言模型

Quanchen Zou, Moyang Chen, Zonghao Ying, Wenzhuo Xu, Yisong Xiao, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract)

AI总结 本文提出面向推理的编程方法,通过链式语义工具突破大型视觉语言模型的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 50%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏