arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2605.26999 2026-05-27 cs.CL cs.CR 79%

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

提示注入检测是依赖于场景的:一种基于可解释结构信号的部署感知评估

Akindoyin Akinrele, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本研究通过多模型、多场景的实验框架,评估了提示注入检测方法,发现检测性能高度依赖于部署场景和阈值选择,其中基于Transformer的模型表现最佳,结构信号在特定场景下提供适度但一致的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26159 2026-05-27 cs.NI cs.CR cs.LG 79%

Device Context Protocol: A Compact, Safety-First Architecture for LLM-Driven Control of Constrained Devices

设备上下文协议:一种紧凑、安全优先的架构,用于LLM驱动的受限设备控制

Dongxu Yang

机构 * DeepLethe

专题命中 提示注入 :safety(title,abstract);分类 cs.LG

AI总结 针对LLM控制受限设备的安全问题,提出设备上下文协议(DCP),通过极小的帧开销、协议层安全原语和主机端桥接,在保持低资源占用的同时有效防御幻觉和提示注入攻击。

Comments 15 pages, 5 figures. Reference implementation, Python package (pip install pydcp), and reproduction scripts at https://github.com/device-context-protocol/dcp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26269 2026-05-27 cs.CR 71%

AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents

AgentSecBench:测量LLM智能体中的提示注入、隐私泄露和工具使用完整性

Faruk Alpay, Taylan Alpay

专题命中 提示注入 :prompt injection(title)

AI总结 提出AgentSecBench框架,通过定义意图到执行的无干扰游戏,系统评估LLM智能体在指令完整性、检索机密性和能力完整性方面的安全风险,并实验验证防御措施的有效性。

Comments 24 pages, 3 figures. Ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26497 2026-05-27 cs.CR 67%

Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents

对齐来源与授权:面向LLM智能体的双图防御

Peiran Wang, Ying Li, Yuan Tian

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 提出AuthGraph双图对齐防御框架,通过构建注入推理图与授权图的结构化比较,检测工具调用和参数来源级别的偏差,在AgentDojo上将攻击成功率从40%降至1%并保持76%任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏