arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 14 篇

2604.24542 2026-04-28 cs.CR cs.AI cs.CL 87%

Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models

用于大语言模型运行时恶意行为检测的分层收敛指纹

Nay Myat Min, Long H. Pham, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);prompt injection(abstract,abstract_cn);alignment(abstract);safety(abstract)

AI总结 本文提出LCF方法,通过分析神经网络层间隐藏状态轨迹来检测运行时恶意行为,无需参考模型或重训练,有效降低攻击成功率并高检测率识别多种威胁。

Comments 34 pages, 5 figures. Code: https://github.com/NayMyatMin/LCF-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR 82%

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 81%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 70%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23338 2026-04-28 cs.CR cs.LG 70%

From Stateless Queries to Autonomous Actions: A Layered Security Framework for Agentic AI Systems

从无状态查询到自主行动:面向代理AI系统的分层安全框架

Kexin Chu

机构 * School of Computing, University of Connecticut(康涅狄格大学计算机学院)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.LG

AI总结 本文提出分层攻击面模型,分析代理AI系统安全威胁的分层结构与时间维度,揭示高层攻击与慢烧时间的交集区域,提出跨层防御体系,强调将代理安全视为嵌入对抗生态的分布式系统问题。

Comments 23 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23711 2026-04-28 cs.CR 67%

Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing

Spore:通过推理时间混合探测实现高效的隐私提取攻击

Yu Cui, Ruiqing Yue, Hang Fu, Sicheng Pan, Zhuoyu Sun, Baohan Huang, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 本文提出Spore攻击,通过推理时间混合探测实现对LLM内存的隐私提取,无需训练,适用于黑盒和灰盒环境,具有高效查询和高信息泄露率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24082 2026-04-28 cs.CR cs.AI cs.CL 62%

Jailbreaking Frontier Foundation Models Through Intention Deception

通过意图欺骗突破前沿基础模型

Xinhe Wang, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。

Comments Accepted at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20833 2026-04-28 cs.CR cs.AI cs.CL 62%

AVISE: Framework for Evaluating the Security of AI Systems

AVISE:人工智能系统安全性的评估框架

Mikko Lempinen, Joni Kemppainen, Niklas Raesalmi

机构 * University of Oulu(奥卢大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AVISE框架,用于识别和评估人工智能系统安全漏洞,通过改进的Red Queen攻击和自动化安全测试发现语言模型的逃逸漏洞,展示了框架的高效性和广泛适用性。

Comments Fixed LaTex label command typos in Tables 8 and 9; fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16182 2026-04-28 cs.CR cs.CL 57%

DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack

DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Shi Wang, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 57%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23124 2026-04-28 cs.SE cs.AI 57%

ArgRE: Formal Argumentation for Conflict Resolution in Multi-Agent Requirements Negotiation

ArgRE:基于形式论证的多智能体需求协商中的冲突解决

Haowei Cheng, Milhan Kim, Chong Liu, Teeradaj Racharak, Truong Vinh Truong Duy, Phan Thi Huyen Thanh, Jialong Li, Naoyasu Ubayashi, Hironori Washizaki

机构 * Department of Computer Science and Communications Engineering, Waseda University(早稻田大学计算机科学与通信工程系) College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics, Tohoku University(东北大学So-Go-Chi(融合知识)信息学高级研究所) Aisin Corporation(日产公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 ArgRE通过嵌入Dung风格的抽象论证,提供多智能体需求协商中的冲突解决,提升可审计性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24051 2026-04-28 cs.CR 50%

System-aware contextual digital twin for ICS anomaly diagnosis

面向系统的上下文数字孪生用于ICS异常诊断

Eungyu Woo, Yooshin Kim, Wonje Heo, Donghoon Shin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出一种面向系统的无监督框架,结合轻量级在线检测与上下文解释,实现ICS异常诊断的实时检测和可解释诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02450 2026-04-28 cs.CV 50%

GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection

GCP: 带空间-时间感知恶意代理检测的防护协作感知

Yihang Tao, Senkang Hu, Yue Hu, Haonan An, Hangcheng Cao, Yuguang Fang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。

Comments Accepted by IEEE TDSC

详情

展开后加载摘要…

URL PDF HTML 收藏