Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :trustworthy(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments 33 pages, 20 figures
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :harmlessness(title,abstract);RLHF(abstract);red teaming(abstract);分类 cs.AI、cs.LG
Comments 18 pages, 7 figures
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 9 figures, 4 tables
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);harmlessness(abstract);分类 cs.CL
Comments Published in ICLR 2025, code in https://github.com/exlaw/TIS-DPO
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
用户侧记忆中的子模块不对称性:一个诊断框架
机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。
Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory
MaPPO:结合先验知识的最大后验偏好优化
机构 * Purdue University(普渡大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Meta, FAIR ; Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动) ; National University of Singapore(新加坡国立大学) ; Angelalign Inc., China(中国Angelalign公司)
专题命中 偏好对齐 :alignment(title,abstract);trustworthy(title)
开放权重模型的行为重编程:认知可塑性与对齐边界
机构 * National Supercomputing Centre, Slovakia(斯洛伐克国家超级计算中心)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 该研究通过大规模并行超参数搜索等方法,对开放权重LLMs进行行为重编程,实现了主动苏格拉底式对话框架,明确了PEFT的边界等关键结论,为跨语言行为修改提供了实证框架。
Comments Preprint submitted to arXiv, August 12, 2026. 13 pages, 5 figures
在弱到强对齐中评估风险:从偏差-方差视角出发
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; InstaDeep ; New York University(纽约大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。
探索用于生物医学数据到文本生成的小语言模型的训练后对齐:以药品说明书为例
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL
AI总结 该研究对生物医学数据到文本生成任务训练小语言模型的方法进行比较分析,在药品说明书数据集上用基于Qwen的SLMs探索多种训练后方法,通过整理数据评估模型,结果显示对齐后的SLMs性能优异,GRPO跨数据集性能最稳健。
Comments 10 pages, 1 figures
基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化
机构 * Criteo AI lab(Criteo AI实验室) ; FairPlay joint team(FairPlay联合团队) ; CREST ; ENSAE ; Institut Polytechnique de Paris(巴黎理工学院) ; Inria(法国国家科学与技术研究院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。
以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类
机构 * University of Groningen(格罗宁根大学) ; University Politehnica of Bucharest(布加勒斯特理工大学) ; NVIDIA(英伟达)
专题命中 偏好对齐 :safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL
AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。
涌现对齐
机构 * CIIRC, Czech Technical University in Prague(捷克理工大学CIIRC)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 提出一种在线对齐技术,通过引入良心步骤和基于直接偏好优化的对齐损失,使大语言模型在训练、微调、对抗提示和零样本学习中自我纠正非伦理输出。
Comments Rejected from ICML 2026
SpecAlign: 通过合成数据实现高效的大语言模型规范对齐
机构 * University of Notre Dame(圣母大学) ; Carnegie Mellon University(卡内基梅隆大学) ; LMU Munich(慕尼黑大学) ; University of Southern California(南加州大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。
Comments 58 pages
对齐感知解码
机构 * EPFL, Switzerland(瑞士联邦理工学院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 提出一种推理时增强模型对齐的方法——对齐感知解码(AAD),可解释为隐式奖励优化,无需额外训练,在多种基准和模型规模上优于强基线,并能生成合成数据改善数据受限场景下的对齐。
Comments Accepted at ICML 2026
RLHF的另一面:用于奖励模型自监督改进的在线策略反馈
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract);分类 cs.CL
AI总结 提出SAVE框架,利用价值函数生成在线策略反馈,通过对比学习更新奖励模型,在六个基准上超越现有方法。
谱汤:一种在线偏好对齐的统一框架
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出了一种统一的在线偏好对齐框架Spectral Souping,通过发现LLM中的通用谱表示,实现了高效的模型合并,从而在不需昂贵在线重训练的情况下快速适应个体用户偏好。
在关键领域学习:用于鲁棒偏好对齐的几何锚定
机构 * PYLER ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。
Comments Under Review