arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 6 篇

2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 67%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 57%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11032 2026-05-13 cs.CR cs.AI 57%

Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents

可携带代理记忆:一种用于跨异构AI代理加密验证记忆传输的协议

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出Portable Agent Memory协议,通过结构化内存模型、基于能力的访问控制、抗注入重水化协议和JSON优先的序列化格式,实现跨异构AI代理的安全记忆传输。

Comments 8 pages, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 57%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏