arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2604.02574 2026-04-06 cs.CR cs.AI cs.LG 86%

Understanding the Effects of Safety Unalignment on Large Language Models

理解安全对齐偏差对大语言模型的影响

John T. Halloran

机构 * Leidos(Leidos公司)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。

Comments 12 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13518 2026-04-06 cs.AI cs.NE 70%

AgenticRed: Evolving Agentic Systems for Red-Teaming

AgenticRed:为红队测试设计的进化系统

Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

机构 * University of Washington(华盛顿大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 AgenticRed通过进化算法自动设计红队系统,无需人工干预,显著提升攻击成功率,达到96%-100%的ASR。

Comments Website: https://yuanjiayiy.github.io/AgenticRed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15323 2026-04-06 cs.CL 70%

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

通过输出预填充改进多选问答中的LLM首词预测

Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学与雷焦艾米利亚大学) University of Pisa(比萨大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Brown University(布朗大学) Meta

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出预填充攻击,通过在模型输出前添加结构化自然语言前缀,提升多选问答中LLM首词预测的准确性与可靠性。

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03081 2026-04-06 cs.CR cs.AI cs.CL 62%

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

针对LLM编码代理技能生态系统的供应链污染攻击

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

机构 * Griffith University(格里菲斯大学) The State Information Center(国家信息中心) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Wake Forest University(维克森林大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM编码代理技能生态系统中供应链攻击对行动空间的影响,提出DDIPE方法通过嵌入恶意逻辑到技能文档中实现隐式payload执行,实验显示其在强防御下可绕过11.6%-33.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 62%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03205 2026-04-06 cs.CR cs.LG 57%

A Tsetlin Machine-driven Intrusion Detection System for Next-Generation IoMT Security

基于Tsetlin机器的下一代IoMT安全入侵检测系统

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(挪威阿格德尔大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于Tsetlin机器的入侵检测系统,用于检测针对IoMT网络的多种网络攻击,通过命题逻辑建模攻击模式,实验表明其在二分类和多分类中均优于传统机器学习分类器。

Comments 8 pages, 15 figures, 9 tables. Accepted at the 7th Silicon Valley Cybersecurity Conference (SVCC 2026), California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏