arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 6 篇

2605.01699 2026-05-08 cs.LG cs.AI cs.CR cs.NE 81%

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

探测器几何对齐:在偶然机会以下消除跨序列记忆签名

Anamika Paul Rupa, Anietie Andy

机构 * Howard University(霍华德大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型中记忆痕迹的消除方法,提出通过探测器几何对齐技术在不损害能力的前提下,有效消除跨序列记忆签名,且在多种模型上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05277 2026-05-08 cs.CR 78%

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族

Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。

Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01150 2026-05-08 cs.LG cs.AI cs.CR cs.CV math.OC 62%

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

SMI: 统计成员推断用于可靠未学习模型审计

Jialong Sun, Zeming Wei, Jiaxuan Zou, Jiacheng Gong, Jie Fu, Chengyang Dong, Heng Xu, Jialong Li, Bo Liu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Heilongjiang University(黑龙江大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SMI方法,通过统计成员混合比例评估未学习模型的遗忘率,无需训练影子模型,有效解决传统成员推断攻击的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06239 2026-05-08 cs.LG 57%

When Graph Language Models Go Beyond Memorization

图语言模型超越记忆

Masatsugu Yamada, Mahito Sugiyama

机构 * National Institute of Informatics(日本信息处理研究所) SOKENDAI

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 研究通过诊断协议区分图语言模型的记忆与结构对齐,发现大规模下模型能学习超越记忆的结构规律,但稀有模式仍存在覆盖不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05718 2026-05-08 cs.LG 57%

Enabling Federated Inference via Unsupervised Consensus Embedding

通过无监督共识嵌入实现联邦推断

Yui Hashimoto, Takayuki Nishio, Yuichi Kitagawa, Takahito Tanimura

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Research & Development Group, Hitachi Ltd.(日立株式会社研发部)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出CE-FI框架,通过共识嵌入层和协作输出层实现无需共享模型参数或原始输入的联邦推断,实验表明其在图像分类任务中优于单独推断并在非IID条件下表现优异。

Comments 18 pages, 15 figures, submitted to IEEE Transactions on Mobile Computing (TMC) (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06630 2026-05-08 eess.SY cs.SY 50%

Quantifying Trade-Offs Between Stability and Goal-Obfuscation

量化稳定性与目标混淆之间的权衡

Yixuan Wang, Dan Guralnik, Warren Dixon

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏