arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2603.12275 2026-05-12 cs.CL cs.LG 62%

GONE: Structural Knowledge Unlearning via Neighborhood-Expanded Distribution Shaping

GONE: 通过邻域扩展分布塑造实现结构知识卸载

Chahana Dahal, Ashutosh Balasubramaniam, Zuobin Xiong

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GONE基准,用于评估LLM在结构知识图谱中的知识卸载能力,引入NEDS框架通过图连接性识别相关邻居,实现精确的遗忘边界划分,展示出在知识编辑和卸载任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08651 2026-05-12 cs.CV cs.AI cs.LG 62%

Privacy-Aware Video Anomaly Detection through Orthogonal Subspace Projection

通过正交子空间投影实现隐私感知的视频异常检测

Lei Wang, Wenxiang Diao, Andrew Busch, Jun Zhou, Yongsheng Gao

机构 * School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出正交投影层(OPL)和引导OPL(G-OPL),通过去除无关变化提升异常检测相关特征,同时抑制面部属性以保护隐私,实验表明隐私约束能减少敏感信息并保持检测精度。

Comments Accepted as a Spotlight paper at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05707 2026-05-12 cs.LG cs.CR 57%

Crowding Out The Noise: Algorithmic Collective Action Under Differential Privacy

消除噪声:在差分隐私下的算法集体行动

Rushabh Solanki, Meghana Bhange, Ulrich Aïvodji, Elliot Creager

机构 * University of Waterloo, Vector Institute(滑铁卢大学,向量研究所)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 本文研究了在差分隐私下算法集体行动的挑战,分析了集体行动效果与隐私参数的关系,并通过实验验证了隐私成本对集体形成的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22868 2026-05-12 cs.CR cs.AI 57%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 50%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏