Safety Alignment of LMs via Non-cooperative Games
通过非合作博弈实现语言模型的安全对齐
机构 * DeepMind, London, UK(深度Mind,伦敦,英国)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过非合作博弈实现语言模型的安全对齐
机构 * DeepMind, London, UK(深度Mind,伦敦,英国)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。
安全博弈:通过约束优化实现黑盒大语言模型的推理时对齐
机构 * University of Southampton(南安普顿大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 提出一种无需重新训练或访问模型内部结构的黑盒安全对齐框架,通过将安全与帮助性的权衡建模为二人零和博弈,并在推理时使用线性规划求解均衡策略,实现了黑盒LLM的安全对齐。
可配置奖励模型用于平衡安全对齐
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 提出可配置安全奖励模型(CSRM),通过配置目标数据增强和联合优化,实现对细粒度安全配置和对话细微差别的敏感性,在可配置安全基准上达到最优性能,并改善有用性与安全性的权衡。
专家评估与心理健康AI安全测试中人类反馈的局限性
机构 * Stanford University(斯坦福大学) ; University College London(伦敦大学学院) ; Microsoft(微软)
专题命中 偏好对齐 :safety(title,abstract);AI safety(title);alignment(abstract);分类 cs.AI
AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。
Comments 17 pages, 7 pages of appendix, 21 tables
对数空间中的Guardrails:用于LLM对齐的安全令牌正则化
机构 * Applied Artificial Intelligence Initiative (A2I2)(应用人工智能倡议(A2I2)) ; Deakin University(德克萨斯大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 本文提出安全令牌正则化(STR)方法,通过约束关键令牌的logits来保持细调模型的安全性,实验显示其在安全性和任务性能方面表现优异。
Comments 10 pages, 3 figures
弥合多语言安全鸿沟:为全球南方语言实现高效、文化感知的对齐
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 本文提出为全球南方低资源语言提供高效、文化感知的安全对齐方法,以解决现有安全机制在多语言环境中的失效问题。
Comments Accepted to the EGSAI Workshop at AAAI 2026
SafeNeuron: 大语言模型的神经层面安全对齐
机构 * Xidian University, Xi'an, China(西安电子科技大学) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) ; National University of Singapore,Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。
D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制
机构 * IIIT Delhi(印度理工学院德里分校) ; Microsoft(微软) ; Apple (USA)(苹果(美国)) ; Google (USA)(谷歌(美国)) ; Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.LG
AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) ; Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院) ; ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
Comments 22 pages, 5 figures
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.LG
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; M-A-P ; The Chinese University of Hong Kong(香港中文大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
Comments [NAACL 2025] The first four authors contribute equally, 23 pages, repo at https://github.com/Kizna1ver/DREAM
机构 * Leidos(莱迪斯公司)
专题命中 偏好对齐 :alignment(title,abstract);safety(title);DPO(abstract);分类 cs.LG
Comments 27 pages, 19 figures, 4 tables
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.CL
Comments Accepted by ICLR 2025. Code is available at https://github.com/open-compass/ANAH
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);safety(title,abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
基于多层组合融合的上下文价值对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。
Comments 12 pages, 5 figures, 5 tables
基于人类反馈强化学习中的人类信念描述性与规范性理论
机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) ; Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)
专题命中 偏好对齐 :RLHF(title,summary_cn);分类 cs.AI、cs.LG
AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。
Comments Published at TMLR
面向规范学习:从偏好对进行推理时对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title);分类 cs.CL、cs.AI
AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。
你的鼠标和眼睛悄悄泄露你的偏好:利用用户隐式反馈进行LLM对齐
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; York University(约克大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title);分类 cs.CL、cs.LG
AI总结 针对显式反馈稀缺的问题,提出利用鼠标轨迹和眼动数据等隐式反馈训练奖励模型,将文本奖励模型准确率从55%提升至64%,并显著提高DPO对齐后响应质量。
语言模型中对齐算法的机制分析
机构 * University of Copenhagen(哥本哈根大学) ; Independent(独立研究者) ; IIT Jodhpur(印度理工学院焦特布尔分校) ; NIT Agartala(印度国立理工学院阿加尔塔拉分校) ; Narris
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。
Comments Work in Progress
两人即可:你的GRPO其实暗含DPO
机构 * UdeM(蒙特利尔大学) ; McGill(麦吉尔大学) ; Mila(Mila人工智能研究院) ; UManitoba(曼尼托巴大学) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; UAlberta(阿尔伯塔大学) ; Amii(阿米人工智能研究院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.LG
AI总结 本文提出2-GRPO,通过仅两个rollouts构建对比信号,理论分析显示其性能接近16-GRPO,训练效率提升显著。
强化学习中对抗性令牌优化
机构 * Department of System Engineering(系统工程系) ; Boston University(波士顿大学) ; Department of Math & Statistics(数学与统计学系)
专题命中 偏好对齐 :RLHF(title,summary_cn);分类 cs.AI、cs.LG
AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。
如何在RL后训练中压缩KV缓存?基于影子遮罩的内存高效对齐
机构 * Yale University(耶鲁大学) ; University of Minnesota Twin Cities(明尼苏达大学双城分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 偏好对齐 :alignment(title);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出影子遮罩蒸馏方法,用于缓解RL后训练中KV缓存内存瓶颈问题,通过减少采样时的上下文密度来降低偏置,提升样本效率。
朝着弥合直接对齐算法中的奖励生成差距而努力
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);RLHF(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。
Comments Findings of ACL 2026
通过魔法令牌引导的协同训练实现LLM中的高效可切换安全控制
机构 * Qiyuan Tech, Beijing, China(北京奇元科技)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);DPO(abstract)
AI总结 本文提出通过魔法令牌引导的协同训练框架,实现LLM内容安全的高效可切换控制,提升安全性能并降低训练与部署成本。
Comments 15 pages,3 figures,5 tables
DeAL:大型语言模型的解码时间对齐
机构 * University of Southern California(南加州大学) ; Ω WS AI Labs(Ω WS AI实验室)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)
AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。
Comments ACL 2025
通过价值去相关与外推实现大语言模型的多值对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。
Comments accepted by AAAI26 oral; 12 pages