Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
安全能否从弱监督中涌现?小型语言模型的系统分析
机构 * Samsung Research Institute(三星研究院)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Self-MOA通过弱监督实现小型语言模型的安全对齐,显著提升安全性的同时保持有用性,减少对人工标注数据的依赖。
Comments 19 pages, 10 tables, 7 figures, under Review
逆强化学习与动态奖励缩放用于大语言模型对齐
机构 * Beijing Electronic Science and Technology Institute(北京电子科技学院) ; Alibaba Group(阿里巴巴集团) ; Nanjing University(南京大学) ; Duke University(杜克大学) ; BraneMatrix AI ; Renmin University of China(中国人民大学) ; Northeast University(东北大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang Lab(浙江实验室) ; Sun Yat-sen University(中山大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DR-IRL通过动态奖励缩放和逆强化学习提升大语言模型的安全对齐性能,有效解决数据不平衡和静态奖励模型的局限性。
在RLHF中引入乐观探索的通用探索奖金
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GEB框架,通过理论分析和实验验证,解决了RLHF中乐观探索的偏差问题,提供了一种统一且有效的探索奖金方法。
Comments ICLR 2026
混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性
专题命中 偏好对齐 :harmlessness(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。
Comments arxiv version of NeurIPS2025
SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化
机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) ; Alibaba Group, China(阿里集团,中国)
专题命中 偏好对齐 :DPO(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。
Comments 39 pages, 15 figures, 16 tables, 60 equations
渐近通用对齐:通过测试时间缩放实现的新对齐框架
机构 * Yale University(耶鲁大学)
专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract)
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University College London(伦敦大学学院)
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 27 pages, 9 figures, 5 tables. Accepted to EMNLP 2025
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The code is at https://github.com/mzhaoshuai/RefAlign
机构 * Team Project Leader(团队项目负责人)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments update template
机构 * Ruhr University Bochum(鲁尔大学波恩)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ECML/PKDD 2025
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 12 pages, 5 figures, 7 tables
机构 * Microsoft(微软公司) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Presented at ICML 2025
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract)
Comments 59 pages, 10 figures
机构 * IIIS, Tsinghua University, Beijing, China(清华大学信息科学技术学院,北京,中国) ; Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国) ; Department of Computer Science, University of California, Los Angeles, California, USA(计算机科学系,加州大学洛杉矶分校,美国,加州)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)
机构 * Kakao Corp(Kakao公司) ; LBOX
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025 main
机构 * Indian Institute of Science(印度科学研究院) ; University of Maryland(马里兰大学) ; Boston University(波士顿大学) ; Indian Institute of Technology Kanpur(印度理工学院坎普尔分校)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ECML-PKDD 2025. Camera ready version
机构 * The CoAI Group, DCST, BNRist, Tsinghua University(清华大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025
机构 * Center for AI Safety and Governance, Institute for AI, Peking University(人工智能安全与治理中心,人工智能研究院,北京大学) ; Tsinghua University(清华大学) ; Baichuan Inc(北川公司)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 46 pages, ACL 2025 (Findings)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICML 2025
机构 * Cornell University(康奈尔大学) ; Princeton University(普林斯顿大学) ; Databricks Mosaic Research(Databricks 混合研究) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 17 pages
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref ICLR 2025
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages