SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);trustworthy(abstract)
Comments 47 pages, 18 figures, authors are listed in alphabetical order by their last names; v3 modifies minor issues
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)
Comments Findings of ACL 2024
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);harmlessness(abstract)
专题命中 偏好对齐 :alignment(title,abstract);safety(title);分类 cs.CL、cs.AI、cs.LG
Comments 23 pages, 4 figures
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
因式分解因果表示学习用于RLHF中的鲁棒奖励建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; University of California San Diego(加州大学圣地亚哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG
AI总结 本文提出因式分解表示学习框架,通过分离因果因素与非因果因素提升奖励模型鲁棒性,有效缓解奖励黑客问题。
评估GRPO和DPO在LLM中的忠实链式推理能力
机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。
对齐欺骗 - 训练到部署的不对称性:通过博弈论视角的贝叶斯-斯克尔伯格均衡
机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa学院) ; Apple, USA(苹果公司) ; Google, USA(谷歌公司)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);harmlessness(abstract)
AI总结 通过博弈论视角研究AI对齐欺骗现象,分析不同偏好优化方法在安全、无害和有用性方面的表现,揭示其成因及发生条件。
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)
Comments Technical report, work in progress
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)
规范陷阱:为何仅靠静态价值对齐无法实现稳健对齐
机构 * Belmont University(贝尔蒙特大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG
AI总结 本文指出静态内容导向的人工智能价值对齐在能力扩展、分布偏移和自主性提升时无法实现稳健对齐,探讨了哲学难题及现有方法的结构性漏洞。
Comments 31 pages, no figures. Version 5. First posted as arXiv:2512.03048 in November 2025. First in a six-paper research program on AI alignment
对齐作为制度设计:从行为修正到智能系统中的交易结构
机构 * Shanghai Sanda University(上海沙达大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。
Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium
基于注意力机制的高维非线性自回归模型:训练、对齐与推理
机构 * Cornell University(康奈尔大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。
Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project code, model and data: https://github.com/findalexli/mllm-dpo
Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14188-14200, 2024
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The code and model are released at https://github.com/Haoxiang-Wang/directional-preference-alignment
大语言模型中跨语言事实一致性的推理时引导
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。
Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop
超越统一遗忘:不同偏好设置下顺序直接偏好优化的研究
机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) ; School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) ; School of Psychological Science, The University of Western Australia(西澳大学心理科学学院) ; School of Computing, Macquarie University(麦考瑞大学计算机学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究顺序DPO在不同偏好设置下的影响,发现遗忘模式并非统一,而是取决于目标关系、信号强度和训练顺序,并提出未来对齐流程应考虑目标兼容性。
Comments Submitted to EMNLP 2026
CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)
专题命中 偏好对齐 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI
AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。
APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈
机构 * University of California, Irvine(加利福尼亚大学尔湾分校)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG
AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。
超越RLHF和NLHF:在公理框架下的人口比例对齐
机构 * MIT LIDS(麻省理工学院LIDS) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。
Comments ICLR 2026
专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract,comments);alignment(abstract);分类 cs.AI、cs.LG
Comments 53 pages; theoretical study and algorithmic design of iterative RLHF and DPO
从阿谀共识到多元修复:为何AI对齐必须显现分歧
机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) ; Responsible Technology Institute, University of Oxford(牛津大学负责任技术研究所)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出多元对齐需通过对话机制表面价值冲突,提出多元修复评分指标,探讨部署阶段的治理层对多元主义的影响。
SPINAL -- 神经对齐层中的缩放律与偏好整合
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。
机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Stony Brook University(石溪大学) ; Institute for Advanced Computational Science(先进计算科学研究所) ; Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) ; AI Innovation Institute(人工智能创新研究院) ; Bloomberg(彭博) ; Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) ; San Francisco, CA 94105(旧金山,CA 94105) ; Bloomberg New York, NY 10022(纽约,NY 10022)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输联合实验室,(北京交通大学)教育部) ; School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(计算机科学与技术学院,北京交通大学,北京,中国) ; Tencent Inc, China(腾讯公司,中国)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025 Main Conference, code available at: https://github.com/songmzhang/AlignDistil
机构 * Princeton University(普林斯顿大学)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 27 pages, 18 figures