arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2503.15772 2026-03-13 cs.DL cs.AI cs.CR 57%

Detecting LLM-Generated Peer Reviews

检测由大语言模型生成的同行评审

Vishisht Rao, Aounon Kumar, Himabindu Lakkaraju, Nihar B. Shah

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种通过间接提示注入在同行评审中嵌入隐蔽水印的方法,用于检测由大语言模型生成的评审,该方法具有强统计保证并能有效应对常见防御措施。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11619 2026-03-13 cs.CR cs.AI 57%

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

驯服OpenClaw:自主LLM代理威胁的分析与缓解

Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li

机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏