arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2606.29623 2026-06-30 cs.AI cs.LG 62%

SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings

SCARCE: 基于嵌入的可扩展级联分析用于罕见事件表征

Yingjie Wang, Yi Dong, Edmund Lau, Jie Meng, Taylor T Johnson, Xiaowei Huang

机构 * University of Liverpool, UK(利物浦大学) UK AI Security Institute, UK(英国人工智能安全研究所) Loughborough University, UK(洛桑大学) Department of Computer Science, Vanderbilt University, USA(范德比大学计算机科学系)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出SCARCE方法,用学习到的潜在表示和几何标尺替代传统子集模拟中的性能函数,通过自适应阈值构建嵌套事件,在MNIST误分类和LLM越狱任务中实现更低的估计误差和更好的可迁移性。

Comments 23 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28425 2026-06-30 cs.CR cs.AI 57%

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

工具使用使多智能体LLM系统中的隐写术无法检测

Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa, Christian Schroeder de Witt

机构 * Oxford University(牛津大学) Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。

详情

展开后加载摘要…

URL PDF HTML 收藏