arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2604.16606 2026-04-21 cs.CR cs.LG 85%

SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models

SafeLM:面向可信联邦大语言模型的统一隐私意识优化

Noor Islam S. Mohammad, Uluğ Bayazıt

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 隐私与版权 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 SafeLM通过整合隐私、安全、虚假信息和对抗鲁棒性四大支柱,提升联邦大语言模型的可信度,实现98%有害内容检测准确率,降低通信开销并提升隐私保护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14548 2026-04-21 cs.SD cs.LG eess.AS 70%

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里

Yuxiang Wang, Hongyu Liu, Yijiang Xu, Qinke Ni, Li Wang, Wan Lin, Kunyu Feng, Dekun Chen, Xu Tan, Lei Wang, Jie Shi, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL 57%

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 57%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏