arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2603.20957 2026-03-31 cs.CL cs.AI cs.CY 87%

Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models

对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆

Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg, Tuhin Chakrabarty

机构 * Stony Brook University(石溪大学) Carnegie Mellon University(卡内基梅隆大学) Columbia Law School(哥伦比亚法学院)

专题命中 隐私与版权 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。

Comments Preprint Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23362 2026-03-31 cs.CL cs.AI 73%

Dual-Space Smoothness for Robust and Balanced LLM Unlearning

双空间平滑性用于鲁棒且平衡的LLM反学习

Han Yan, Zheyuan Liu, Meng Jiang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26786 2026-03-31 cs.LG cs.AI 62%

A Step Toward Federated Pretraining of Multimodal Large Language Models

迈向多模态大语言模型联邦预训练的一小步

Baochen Xiong, Yifan Xu, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27994 2026-03-31 cs.HC cs.CY 57%

Filipino Students' Willingness to Use AI for Mental Health Support: A Path Analysis of Behavioral, Emotional, and Contextual Factors

菲律宾学生使用AI进行心理健康支持的意愿:行为、情感和情境因素的路径分析

John Paul P. Miranda, Rhiziel P. Manalese, Ivan G. Liwanag, Rodel T. Alimurong, Alvin B. Roque

专题命中 隐私与版权 :safety(abstract);分类 cs.CY

AI总结 研究探讨了行为、情感和情境因素如何影响菲律宾学生使用AI进行心理健康支持的意愿,发现习惯对意愿影响最大,后续为舒适度、情感益处等因素,强调情感安全与常规使用对提升意愿的重要性。

Comments 24 pages, 5 figures, 1 table, book chapter

Journal ref Implications for Students' Mental Health in the Digital Age: AI and Cyber Behavior (2026) 381-404

详情

展开后加载摘要…

URL PDF HTML 收藏