arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2605.06669 2026-05-22 cs.CR cs.AI cs.LG 84%

Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs

评估教育LLM导师的提示注入防御:安全-可用性-延迟的权衡

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 提示注入 :prompt injection(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估提示注入防御方法的框架,探讨了在教育LLM导师中安全、可用性和延迟之间的权衡,并通过实验比较了不同防御机制的性能。

Comments 19 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 57%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏