Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆
机构 * Stony Brook University(石溪大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia Law School(哥伦比亚法学院)
专题命中 隐私与版权 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。
Comments Preprint Under Review