arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2510.22628 2026-05-04 cs.CR cs.AI 70%

Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts

Sentra-Guard:一种实时多语言对抗对抗性LLM提示的防御系统

Md. Mehedi Hasan, Sk Tanzir Mehedi, Ziaur Rahman, Rafid Mostafiz, Md. Abir Hossain

专题命中 提示注入 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Sentra-Guard通过混合架构和分类器-检索器融合模块,实时检测并缓解针对大语言模型的劫持和提示注入攻击,实现多语言鲁棒性与高检测率。

Comments 11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06572 2026-05-04 cs.CR 50%

Parasites in the Toolchain: A Large-Scale Analysis of Attacks on the MCP Ecosystem

工具链中的寄生体:对MCP生态系统的大型分析

Shuli Zhao, Qinsheng Hou, Zihan Zhan, Yanhao Wang, Yuchong Xie, Yu Guo, Libo Chen, Shenghong Li, Zhi Xue

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究发现MCP生态中存在寄生工具链攻击,攻击者通过恶意指令渗透工具链,窃取隐私数据,揭示MCP缺乏安全隔离机制,需加强防御。

Comments Accepted by IEEE Symposium on Security and Privacy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏