On Diversified Preferences of Large Language Model Alignment
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments EMNLP 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments EMNLP 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL
Comments Accepted by CCL 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments TrustNLP@NAACL2024 (Fourth Workshop on Trustworthy Natural Language Processing)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments 24 pages, 5 pages
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.LG
Comments NeurIPS 2023. Code available at: https://github.com/ngruver/llmtime
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL
Comments accepted by ACL (Findings) 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted to ACL 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 16 pages, 9 figures, 9 tables
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);SFT(abstract)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 12 pages, 2 Figures
Journal ref Royal Society Open Science 11 (2), 231393 (2024)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by EACL 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments Preprint
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted for the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP, Main)
CAPO:面向大语言模型智能体的感知约束提示优化
机构 * Microsoft(微软)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
Domyn-Small:一个欧洲的100亿参数推理语言模型
机构 * CINECA(意大利国家计算应用研究所)
专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract);post-training(abstract)
AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。
Comments 27 pages, 5 figure
数字万神殿:使用大语言模型智能体模拟和审计联盟形成
机构 * Ghent University(根特大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)
AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。
Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference
自我改进可能导致自我退化:LLM自我训练的兴起与崩溃失败模式
机构 * MetaAI
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM自我训练中pass@1先升后降的崩溃模式,发现非跨任务遗忘而是策略过度优化,提出CARE、ES和GRPO三种控制方法,在Qwen-2.5模型上验证效果。
Comments 31 pages
3SPO: 面向LLM智能体的状态分数监督策略优化
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Fudan University(复旦大学) ; KAUST(卡塔尔人工智能研究学院) ; Fuzhou University(福州大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。
Critique-GRPO:通过自然语言和数值反馈提升大语言模型推理能力
机构 * HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国) ; University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) ; MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Critique-GRPO框架,结合自然语言和数值反馈提升LLM推理能力,实验显示其在多个任务中优于传统方法,显著提升推理性能。
Comments Accepted by ICML 2026 Spotlight
Macro: 通过偏好对齐优化提升多语言反事实解释
机构 * Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; University of Duisburg-Essen(杜伊斯堡- Essen大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Saarland Informatics Campus(萨尔兰州信息学校区) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) ; Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。
Comments In submission
通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客
机构 * Zhejiang University(浙江大学)
专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。
Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model
Margin Adaptive DPO: 利用奖励模型实现偏好优化中的细粒度控制
机构 * Independent Researcher(独立研究者)
专题命中 后训练与偏好优化 :preference optimization(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Margin-Adaptive Direct Preference Optimization (MADPO)方法,通过奖励模型估计偏好边界并自适应调整DPO损失权重,实现实例级别的细粒度控制,在摘要任务上优于现有方法。
UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI
AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。
多模态对齐与偏好优化用于零样本条件RNA生成
机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔INP、LJK实验室) ; Center for Computational Mathematics, Flatiron Institute(计算数学中心、Flatiron研究所)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract)
AI总结 提出Moirain框架,通过多模态监督微调和直接偏好优化实现条件RNA序列生成,在零样本条件下生成具有高结合亲和力的生物合理RNA序列。
重新思考LLM策略优化中的重要性采样:从累积token视角
机构 * UIUC(伊利诺伊大学香槟分校) ; University of Michigan(密歇根大学) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。
ProAgent:利用按需感官上下文实现野外的前瞻性LLM代理系统
机构 * The Chinese University of Hong Kong(香港中文大学) ; Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 ProAgent通过整合低成本上下文线索与按需丰富感知,实现连续感知用户环境,利用上下文感知的前瞻性推理器推断用户需求,提升预测准确性与降低误检率。
适应性批级样本调度用于直接偏好优化
机构 * Beihang University(北京航空航天大学) ; Bytedance China(字节跳动中国) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出SamS算法,通过动态调度训练样本提升DPO性能,无需修改核心算法,有效提高LLM对齐效果。