arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 5 篇

2511.20597 2026-08-13 cs.LG cs.AI cs.CR 版本更新 84%

BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents

BrowseSafe: 理解和防止AI浏览器代理中的提示注入

Kaiyuan Zhang, Mark Tenenholtz, Kyle Polley, Jerry Ma, Denis Yarats, Ninghui Li

机构 * Purdue University(普渡大学) Perplexity AI

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 BrowseSafe通过构建现实场景下的提示注入攻击基准,提出多层次防御策略,旨在提升AI浏览器代理的安全性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 83%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08417 2026-08-13 cs.CR 版本更新 78%

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击

Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12172 2026-08-13 cs.MA 新提交 67%

Rethinking Agent Security as a Networking Problem

将智能体安全重新思考为一个网络问题

Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 57%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 提示注入 :safety(abstract);分类 cs.CY

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏