arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-10 至 2026-04-10 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2510.07809 2026-04-10 cs.CR cs.AI 85%

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08297 2026-04-10 cs.CR 78%

Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models

向大规模语言模型中安全关键参数的识别与干预迈进

Weiwei Qi, Zefeng Wu, Tianhang Zheng, Zikang Zhang, Xiaojun Jia, Zhan Qin, Kui Ren

专题命中 越狱攻击 :safety(title,abstract)

AI总结 本文提出ESI框架量化不同参数对LLM安全的影响,揭示不同架构中安全关键模式,并引入SET和SPA干预方法提升安全性和稳定性。

Comments 20 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07835 2026-04-10 cs.AI 77%

Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation Ablation

消除守护栏:通过动态上下文表示消解进行推理时的劫持

Wenpeng Xing, Moran Fang, Guangtai Wang, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出CRA框架,通过动态抑制模型守护栏来提升推理时的劫持防御能力,实验显示其在多个开源LLM上表现优异,揭示了当前对齐机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06975 2026-04-10 cs.CR cs.AI cs.CL 73%

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

对黑盒LLM API进行基于排名的均匀性测试

Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于排名的均匀性测试方法,用于验证黑盒LLM与本地部署的模型行为一致性,有效检测API提供者可能的模型替换或篡改行为,具有高准确性和低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 57%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07615 2026-04-10 cs.CL 57%

ADAG: Automatically Describing Attribution Graphs

ADAG:自动描述归因图

Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

机构 * Stanford University(斯坦福大学) Transluce

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 ADAG通过自动化方法描述归因图,利用归因轮廓和聚类算法生成可解释的电路结构,并发现Llama 3.1 8B Instruct中的有害建议 jailbreak聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02670 2026-04-10 cs.CL 57%

Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting

攻破我:通过词性插入提示实现对对齐大语言模型的自我越狱

Devang Kulshreshtha, Hang Su, Haibo Jin, Chinmay Hegde, Haohan Wang

机构 * Amazon(亚马逊) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 本文提出自我越狱方法,通过词性插入提示对齐大语言模型进行攻击,实验表明SLIP在多个模型上实现高攻击成功率,提出SDM防御机制但发现其对自适应攻击策略仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08291 2026-04-10 cs.GT cs.CR cs.OS 50%

VCAO: Verifier-Centered Agentic Orchestration for Strategic OS Vulnerability Discovery

VCAO:以验证者为中心的代理协调用于战略操作系统漏洞发现

Suyash Mishra

专题命中 越狱攻击 :safety(abstract)

AI总结 VCAO通过博弈论方法优化操作系统漏洞发现,利用多代理系统在资源约束下实现高效漏洞检测,相比传统方法提升漏洞发现效率并降低误报率。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏