Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
少样本真正无害的DPO攻击用于对抗LLMs
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
少样本真正无害的DPO攻击用于对抗LLMs
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。
安全对齐作为持续学习:通过正交梯度投影缓解对齐税
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。
BSO:安全对齐是密度比匹配
机构 * Hanoi University of Science and Technology(河内科学技术大学) ; Deakin University(德金大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校) ; VinUniversity(文大学) ; Monash University(墨尔本大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出BSO方法,通过密度比匹配实现安全对齐,简化了安全对齐流程,无需辅助模型,且能提升安全与有用性之间的权衡。
利用RAG实现无需训练的LLM对齐
机构 * Leidos(莱迪奥斯公司)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAG-Pref算法,通过对比信息提升对抗攻击拒绝能力,相比其他方法在五种主流LLM上提升3.7倍,同时保持计算效率。
Comments 19 pages, 4 figures, and 6 tables
StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐
机构 * Tufts University(塔夫茨大学) ; Bose Corporation(博世公司)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。
HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。
Comments Accepted by ACL 2026 Findings
语义奖励崩溃与自适应AI系统中知识完整性保护
机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI
AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。
Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587