arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2606.04329 2026-06-23 cs.CR cs.AI 版本更新 57%

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10104 2026-06-16 cs.CR cs.AI cs.IR 交叉投稿 57%

Phishing Email Detection Using Large Language Models

使用大型语言模型检测钓鱼邮件

Najmul Hasan, Prashanth BusiReddyGari, Haitao Zhao, Yihao Ren, Jinsheng Xu, Shaohu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出LLMPEA框架,利用GPT-4o等三种前沿LLM检测钓鱼邮件,准确率超90%,并揭示对抗攻击、提示注入和多语言攻击的漏洞。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04981 2026-06-15 cs.CV cs.LG 版本更新 57%

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的人口统计偏见

NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

机构 * KAIST(韩国科学技术院) HKUST (GZ)(香港科技大学(广州))

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 研究LLM增强的文本到图像系统在提示扩展中引入隐性人口统计偏见的问题,提出无训练的去偏框架FairPro,通过自适应生成公平性指令减少人口统计差异。

Comments Project page: https://fairpro-t2i.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13038 2026-06-12 cs.AI 新提交 57%

Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior

Nous: 提取并注入预测市场行为背后认知的尝试

Haowei Qian

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM代理在预测市场中认知同质化问题,提出Nous方法从真实交易行为提取八维行为画像并注入提示,发现提取部分有效但提示注入无法传递认知多样性。

Comments 37 pages, 1 figure, 7 tables. Reproduction artifacts (code, frozen profiles, prompts, model outputs): https://github.com/WillChienT/nous-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09923 2026-06-05 cs.AI 57%

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Toronto & Vector Institute(多伦多大学及向量研究所) ETH Zurich(苏黎世联邦理工学院) AI Security Company(人工智能安全公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04141 2026-06-04 cs.CR cs.AI 57%

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

当场抓获(激活):面向LLM智能体的凭证泄露预输出和多轮检测

Kargi Chauhan, Pratibha Revankar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究通过激活探针、蜜令令牌和累积信息流追踪三种互补防御方法,在预输出和多轮对话中检测LLM智能体的凭证泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03777 2026-06-03 cs.AI cs.CR q-fin.RM 57%

From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the CER Framework

从控制边界到保险索赔:通过CER框架重构AI中介损失

Alex Leung, Rex Zhang, Kentaroh Toyoda, SiewMei Loh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出CER框架(控制边界、证据重构、保险响应),用于诊断和重构由生成式或代理式AI系统导致的损失,以支持保险索赔。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23593 2026-06-02 cs.AI 57%

When AI reviews science: Can we trust the referee?

当AI评审科学:我们能信任审稿人吗?

Jialiang Wang, Yuchen Liu, Hang Xu, Kaichun Hu, Shimin Di, Wangze Ni, Linan Yue, Min-Ling Zhang, Kui Ren, Lei Chen

机构 * School of Electronic Engineering, Southeast University(东南大学电子工程学院) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对AI审稿的安全性和可靠性问题,本文通过分类攻击类型并实验验证声望框架、断言强度、反驳谄媚和上下文投毒对评分的影响,为评估AI同行评审的可靠性提供基线。

Journal ref The Innovation Informatics 2:100030 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30454 2026-06-01 cs.CR cs.AI 57%

The Surface You Test Is Not the Surface That Breaks

测试的表面并非断裂的表面

Shifat E Arman, Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文发现工具增强的LLM代理对提示注入的脆弱性依赖于攻击表面(工具输出 vs 工具描述),提出自适应攻击率并强调评估需报告每个表面的脆弱性。

Comments 8 Figures, 8 Tables, Under Review at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29737 2026-05-29 cs.CR cs.CL cs.SE 57%

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

最小提示扰动导致代码漏洞:编码大语言模型中的提示脆弱性和隐藏状态信号

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO, Le Foyer, Techno-Pôle 1, Sierre, Switzerland(瑞士苏黎世联邦理工学院(HES-SO)技术园区1号,西尔尔) Cyber-Defence Campus, armasuisse Science and Technology, Thun, Switzerland(瑞士图恩 Cyber-Defence 营地,armasuisse 科学与技术)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文通过token级突变实验,发现微小提示扰动(如单字符变化)即可使LLM生成代码从安全变为脆弱,并利用隐藏状态分析揭示输入处理漏洞比安全默认值漏洞更可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26506 2026-05-29 cs.CL cs.CR 57%

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

SafeReview: 防御基于LLM的评审系统免受对抗性隐藏提示攻击

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Backes, Yue Zhang, Linyi Yang

机构 * CISPA Westlake University(西交利物浦大学) Southern University of Science and Technology(南方科技大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 提出SafeReview,一种共进化对抗训练框架,通过联合训练生成器和防御者模型,增强基于LLM的同行评审系统对对抗性隐藏提示的鲁棒性。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 57%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15338 2026-05-19 cs.CR cs.AI 57%

Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

记忆中的隐患:LLM代理中的潜伏记忆污染

Sidharth Pulipaka, Stanislau Hlebik, Leonidas Raghav, Sahar Abdelnabi, Vyas Raina, Ivaxi Sheth, Mario Fritz

机构 * SPAR ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) APTA CISPA Helmholtz Center for Information Security(信息安全海德堡中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理中由于持久化内存带来的安全风险,提出并研究了潜伏记忆污染攻击,该攻击通过操控外部上下文使代理存储伪造的记忆,影响后续交互,实验显示攻击可跨多次对话持续生效。

Comments 86 pages, 60 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16407 2026-05-19 cs.LO cs.CL cs.CR cs.PL 57%

Proof-Carrying Certificates for LLM Pipelines: A Trust-Boundary Architecture

为LLM流水线提供证明携带证书:一种信任边界架构

George Koomullil

机构 * Ascendr, Inc.(Ascendr公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出一种验证大型语言模型周围确定性结构计算的框架,扩展了Lean 4信任边界架构至现代LLM流水线的通用接口。核心贡献包括三个证书家族和两个操作符,用于高风险部署中的专利检索、金融监管等场景。

Comments 83 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 57%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 57%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 57%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11032 2026-05-13 cs.CR cs.AI 57%

Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents

可携带代理记忆:一种用于跨异构AI代理加密验证记忆传输的协议

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出Portable Agent Memory协议,通过结构化内存模型、基于能力的访问控制、抗注入重水化协议和JSON优先的序列化格式,实现跨异构AI代理的安全记忆传输。

Comments 8 pages, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 57%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 57%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16838 2026-05-12 cs.CR cs.AI cs.MA 57%

enclawed: A Configurable, Sector-Neutral Hardening Framework for Single-User AI Assistant Gateways

enclawed:一个可配置、无扇区偏见的单用户AI助手网关加固框架

Alfredo Metere

机构 * Metere Consulting, LLC(梅特尔咨询公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 enclawed为需要可验证的对等信任、默认拒绝外部连接、签名模块加载和可篡改审计追踪的部署提供加固框架,通过两种风味实现数据驱动的分类和高保证的对等认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-05-12 cs.CR cs.AI 57%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08310 2026-05-12 cs.CR cs.AI 57%

WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation

WebTrap: 隐秘的中任务劫持攻击浏览器代理在导航过程中的行为

Zhichao Liu, Wenbo Pan, Haining Yu, Ge Gao, Tianqing Zhu, Xiaohua Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 WebTrap通过多步骤指令融合引导实现浏览器代理在导航任务中的隐秘劫持,提升攻击成功率同时保持系统可用性。

Comments 31 pages, 4 figures, 10 tables. Code: https://github.com/liuyaojialiuyaojia/WebTrap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24020 2026-04-28 cs.CR cs.AI 57%

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents

Poster: ClawdGo: 内生安全意识训练用于自主AI代理

Jiaqi Li, Yang Zhao, Bin Sun, Yang Yu, Jian Chang, Lidong Zhai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Network Management Center, China Mobile Group Liaoning Company Limited(中国移动集团辽宁公司网络管理中心) Tencent Security Xuanwu Lab(腾讯安全宣武实验室) China Unicom Online Information Technology Co., Ltd.(中国联通在线信息技术有限公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出ClawdGo框架,通过内生训练提升自主AI代理的安全意识,引入TLDT、ASAT、CSMA和SACP四种贡献,实验显示ASAT在16次会话中提升TLDT得分,CSMA保持完整收益,SACP在高训练代理中观察到精度-召回权衡。

Comments 4 pages, including 1 poster page. Poster abstract and poster version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08127 2026-04-28 cs.AI 57%

BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks

BlindGuard: 保护基于大语言模型的多智能体系统免受未知攻击

Rui Miao, Yixin Liu, Yili Wang, Xu Shen, Yue Tan, Yiwei Dai, Shirui Pan, Xin Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出BlindGuard,一种无需标注的多智能体系统防御方法,通过层次编码器和腐蚀引导检测器有效检测多种攻击类型,优于监督基线。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19657 2026-04-22 cs.CR cs.AI cs.OS 57%

An AI Agent Execution Environment to Safeguard User Data

一个保障用户数据安全的AI代理执行环境

Robert Stanley, Avi Verma, Lillian Tsai, Konstantinos Kallas, Sam Kumar

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Google(谷歌)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 GAAP通过动态用户提示收集权限规范,确保AI代理在共享用户隐私数据时符合规定,无需信任代理或模型,有效阻止数据泄露攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06922 2026-04-22 cs.CR cs.LG 57%

Whispers in the Machine: Confidentiality in Agentic Systems

机器中的低语:代理系统中的保密性

Jonathan Evertz, Merlin Chlosta, Lea Schönherr, Thorsten Eisenhofer

机构 * CISPA Helmholtz Center for Information Security(信息安全勒内希特中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 研究探讨了基于大语言模型的代理系统中的保密性问题,通过抽象敏感数据为秘密字符串,评估了十种代理在20种工具场景和14种攻击策略下的安全性,发现所有代理均存在至少一种漏洞,现有防御措施无法有效防止数据泄露。

Comments Accepted at Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI 57%

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏