arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2601.10971 2026-03-20 cs.CR cs.CL 83%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11149 2026-03-20 cs.LG cs.CR 79%

Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models

大语言模型中越狱攻击的系统缩放分析

Xiangwen Wang, Ananth Balashankar, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文系统分析了大语言模型中越狱攻击的缩放规律,通过计算限制优化过程评估不同方法、模型家族和危害类型的攻击成功率,发现提示基方法在计算效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16137 2026-03-20 cs.CL 77%

SIA: A Synthesize-Inject-Align Framework for Knowledge-Grounded and Secure E-commerce Search LLMs with Industrial Deployment

SIA:一种用于知识引导和安全的电子商务搜索LLM的合成-注入-对齐框架

Zhouwei Zhai, Mengxiang Chen, Anmeng Zhang

机构 * Beijing China(中国北京)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出SIA框架,通过合成高质量语料库、参数高效预训练和双路径对齐方法,解决电子商务搜索LLM的知识幻觉和安全漏洞问题,并在京东实现工业部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11132 2026-03-20 cs.CR cs.AI 70%

WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inference

WebWeaver: 在LLM多智能体系统中通过隐蔽的基于上下文推断打破拓扑保密性

Zixun Xiong, Gaoyi Wu, Lingfeng Yao, Miao Pan, Xiaojiang Du, Hao Wang

机构 * Department of Electrical and Computer Engineering, Stevens Institute of Technology(斯蒂文斯理工学院电气与计算机工程系) Genentech(基因泰克) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 WebWeaver通过仅 compromise 一个任意智能体推断LLM多智能体系统的完整拓扑,采用隐蔽的基于上下文推断方法,提出新的隐蔽 jailbreak 机制和无 jailbreak 扩散设计,提升推断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏