Preference Optimization with Multi-Sample Comparisons
专题命中 偏好对齐 :alignment(abstract,comments);RLHF(abstract);分类 cs.CL、cs.LG
Comments Code is available at https://github.com/alecwangcq/multi-sample-alignment
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract,comments);RLHF(abstract);分类 cs.CL、cs.LG
Comments Code is available at https://github.com/alecwangcq/multi-sample-alignment
专题命中 偏好对齐 :RLHF(abstract,comments);alignment(abstract);分类 cs.CL、cs.LG
Comments Data available at https://github.com/anthropics/hh-rlhf
语言模型处理差异论元标记中的类型学对齐差异
机构 * University of Washington(华盛顿大学)
专题命中 偏好对齐 :alignment(title);分类 cs.CL
AI总结 通过控制合成语料训练GPT-2模型,发现模型在标记方向(自然标记方向)上表现出类人偏好,但在论元角色偏好(宾语vs主语)上未复现人类语言的强烈宾语偏好。
Comments 16 pages, 8 figures, 7 tables. To appear at CoNLL 2026
Journal ref Proceedings of the 30th Conference on Computational Natural Language Learning (CoNLL 2026), pp. 268-283, San Diego, California, USA, Association for Computational Linguistics, 2026
数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; City College of New York, CUNY(纽约市立大学城市学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。
Comments 19 pages
CriterAlign: 以标准为中心的推理对齐用于代码偏好判断
机构 * KAUST(卡塔尔人工智能研究 institute) ; ByteDance(字节跳动)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 本文提出CriterAlign,一种以标准为中心的推理对齐框架,通过直接的标准级 pairwise 判断、tie-driven 标准细化、swap-consistency 过滤和最终 pairwise 合成,改进了代码偏好判断的准确性,同时引入Human-Preference-Aligned Guidance (HPAG)来提升性能。
一致性最大化改进多元对齐
机构 * George Washington University(乔治·华盛顿大学)
专题命中 偏好对齐 :alignment(title);分类 cs.CL
AI总结 提出内部一致性最大化(ICM)方法,通过最大化标签的互可预测性生成个性化示例,无需人工监督即可将模型与目标群体价值观对齐,并证明示例一致性比单独准确性更重要。
朝向认知忠实决策模型以改善AI对齐
机构 * Duke University(杜克大学) ; IIT Delhi(德里印度理工学院) ; CMU(卡内基梅隆大学)
专题命中 偏好对齐 :alignment(title);分类 cs.LG
AI总结 提出一种基于公理的方法,从成对比较中学习认知忠实的决策过程,以解决标准偏好诱导方法未能捕捉人类决策认知过程的问题,并在肾脏分配任务中验证了模型的有效性。
Comments In ICLR 2026
响应时间增强异质偏好对齐
机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) ; Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) ; Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) ; Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) ; Inria Paris
专题命中 偏好对齐 :alignment(title);分类 cs.LG
AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。
引导推测推断用于大型语言模型的高效测试时间对齐
机构 * Harvard SEAS(哈佛大学SEAS学院) ; Kempner Institute(Kempner研究所) ; IBM Research(IBM研究院)
专题命中 偏好对齐 :alignment(title);分类 cs.LG
AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。
Comments 41 pages, 11 figures. Published at ICLR 2026
MaLoRA:基于关键空间对齐的门控模态LoRA
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) ; Rajiv Gandhi University(拉贾·甘地大学) ; Palmer Research Laboratories(帕勒实验室)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。
DARE:扩散大语言模型对齐与强化执行器
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 偏好对齐 :alignment(title);分类 cs.CL
AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。
Comments 14 pages,3 figures,5 tables
MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。
MAPLE:从统计共识到过程导向对齐的医学推理提升
机构 * Zhejiang University(浙江大学) ; Harvard University(哈佛大学) ; Harvard Medical School(哈佛医学院)
专题命中 偏好对齐 :alignment(title);分类 cs.LG
AI总结 MAPLE通过整合医学过程奖励模型与TTRL,提升医学推理的准确性和可靠性,实现从统计共识到过程导向对齐的转变。
近优主动偏好学习及其在大语言模型对齐中的应用
机构 * University of Arizona(亚利桑那大学) ; Department of Computer Science(计算机科学系)
专题命中 偏好对齐 :alignment(title);分类 cs.LG
AI总结 本文提出两种主动学习算法,通过实例依赖标签复杂性保证和贪心方法提升大语言模型对齐的样本效率。
输入顺序影响多文档摘要中LLM语义对齐
机构 * University of Zurich(苏黎世大学)
专题命中 偏好对齐 :alignment(title);分类 cs.CL
AI总结 研究发现输入顺序显著影响LLM在多文档摘要中的语义对齐,优先位置的文章对摘要的语义相似性有显著影响。
Comments 9 pages, 3 figures, 2 tables
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :DPO(title);分类 cs.LG
Comments NeurIPS 2025
机构 * Intel(英特尔) ; Thoughtworks
专题命中 偏好对齐 :DPO(title);分类 cs.AI
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
Comments Accepted by ACL 2025
专题命中 偏好对齐 :alignment(title);分类 cs.CL
Comments 27 pages
机构 * Amazon(亚马逊)
专题命中 偏好对齐 :alignment(title);分类 cs.LG
Comments NAACL 2025
机构 * Harvard University(哈佛大学) ; Harvard Business School(哈佛商学院)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
Comments Accepted for presentation at the 2025 IEEE International Symposium on Information Theory (ISIT 2025)
专题命中 偏好对齐 :alignment(title);分类 cs.CL
专题命中 偏好对齐 :alignment(title);分类 cs.AI
Comments Project in development. Github: https://github.com/jefferyZhan/Griffon/tree/master/Vision-R1
专题命中 偏好对齐 :alignment(title);分类 cs.AI
Comments Accepted to ICRA 2025. Project page: https://deform-pam.robotflow.ai
专题命中 偏好对齐 :alignment(title);分类 cs.AI
Comments Project page: https://playground.com/pg-v3
专题命中 偏好对齐 :alignment(title);分类 cs.CL
Comments 14 Pages, 12 figures
专题命中 偏好对齐 :alignment(title);分类 cs.CL
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习
机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) ; Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) ; Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.CY