arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 5 篇

2604.17125 2026-04-21 cs.CR cs.AI 79%

CASCADE: A Cascaded Hybrid Defense Architecture for Prompt Injection Detection in MCP-Based Systems

CASCADE:一种用于MCP系统中提示注入检测的级联混合防御架构

İpek Abasıkeleş Turgut, Edip Gümüş

机构 * Department of Computer Engineering, Faculty of Engineering and Natural Sciences(工程与自然科学学院计算机工程系) Department of Computer Engineering, Institute of Graduate Studies(研究生院计算机工程系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出CASCADE架构,通过三级级联机制提升MCP系统中提示注入检测的精度与召回率,实现高检测率与低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03793 2026-04-21 cs.CL cs.CR 79%

AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption

AttnTrace: 基于提示注入和知识腐败的上下文归因

Yanting Wang, Runpeng Geng, Ying Chen, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出AttnTrace,一种基于LLM对提示生成的注意力权重的上下文追溯方法,通过增强效果和技术改进,提高了准确性和效率,并展示了其在检测长上下文中的提示注入应用。

Comments To appear in IEEE S&P 2026. The code is available at https://github.com/Wang-Yanting/AttnTrace. The demo is available at https://huggingface.co/spaces/SecureLLMSys/AttnTrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02850 2026-04-21 cs.CL cs.CR cs.LG 62%

LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users

LLM催眠:利用用户反馈进行未经授权的知识注入以影响所有用户

Almog Hilel, Riddhi Bhagwat, Idan Shenfeld, Jacob Andreas, Leshem Choshen

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) IBM Research(IBM研究院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示语言模型通过用户反馈进行知识注入的漏洞,通过反馈信号可操控模型行为,导致事实错误、代码漏洞和虚假新闻。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17139 2026-04-21 cs.CL cs.AI cs.MA 62%

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

共识陷阱:通过令牌级协作拯救多智能体大语言模型免受对抗性多数的侵害

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Adelaide University(阿德莱德大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出令牌级轮询协作方法,通过共享自回归上下文中的序列生成,解决多智能体系统中对抗性多数导致的响应级聚合失效问题,证明其在多种推理基准上具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI 57%

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏