Detecting LLM-Generated Peer Reviews
检测由大语言模型生成的同行评审
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出了一种通过间接提示注入在同行评审中嵌入隐蔽水印的方法,用于检测由大语言模型生成的评审,该方法具有强统计保证并能有效应对常见防御措施。
Comments 27 pages, 2 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
检测由大语言模型生成的同行评审
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出了一种通过间接提示注入在同行评审中嵌入隐蔽水印的方法,用于检测由大语言模型生成的评审,该方法具有强统计保证并能有效应对常见防御措施。
Comments 27 pages, 2 figures
驯服OpenClaw:自主LLM代理威胁的分析与缓解
机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) ; Tsinghua University(清华大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。