arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2310.17025 2026-05-13 cs.NI cs.AI 57%

netFound: Principled Design for Network Foundation Models

netFound:网络基础模型的原理化设计

Sylee Beltiukov, Satyandra Guthula, Haarika Manda, Jaber Daneshamooz, Wenbo Guo, Walter Willinger, Arpit Gupta, Inder Monga

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Northwestern University(西北大学) ESNet

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 netFound通过四个设计原则提升网络基础模型性能,实现高质量表示与隐私保护,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11685 2026-05-13 cs.CL 57%

Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter

鲁棒的LLM去学习对抗重新学习攻击:表示中的次要成分至关重要

Zeguan Xiao, Xuanzhe Xu, Yun Chen, Yong Wang, Jian Yang, Yanqing Hu, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 本文研究了LLM去学习中对抗重新学习攻击的脆弱性,发现现有方法主要优化主导成分,而次要成分更抗反转。提出Minor Component Unlearning方法,通过聚焦稳健方向提升抗攻击能力。

详情

展开后加载摘要…

URL PDF HTML 收藏