ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.LG
Comments 44 pages, 19 figures, 12 tables
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.LG
Comments 20 pages, 9 figures
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments To appear at NAACL 2024
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Project Website: https://opendatalab.github.io/HA-DPO, Code: https://github.com/opendatalab/HA-DPO
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL
Comments EMNLP 2023 Camera Ready
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL
Comments Preprint
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 22 pages,11 figures
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习
机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) ; Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) ; Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。
DataClaw0: 从原始流中智能定制多模态数据
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。
Comments add base model: Qwen3.5-27B
NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理
机构 * Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)
AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。
OR 否则:用于策略优化的可微信赖域
机构 * Quantiphi Inc(昆蒂菲公司) ; Self Machines Inc(自机器公司) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。
Comments 22 pages, 5 figures
LatentGym: 具有可控潜在结构的跨任务经验学习测试平台
机构 * Columbia University(哥伦比亚大学) ; Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。
Comments 61 pages
通过检索增强生成和多目标对齐统一查询自动补全中的排序与生成
机构 * Apple(苹果公司) ; UC Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出一个统一框架,通过检索增强生成(RAG)和多目标直接偏好优化(DPO)将查询自动补全重构为端到端列表生成,解决传统流水线长尾覆盖不足和生成方法幻觉风险的问题,并在大规模商业搜索平台上验证了有效性。
Comments 11 pages, 4 figures
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea
高速率量化矩阵乘法II
机构 * Hebrew University of Jerusalem(希伯来大学杰里科分校) ; MIT(麻省理工学院)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文研究在已知第二因子列协方差矩阵情况下高速率量化矩阵乘法,通过水填充算法改进LLM量化方法,展示WaterSIC方案在信息论极限下的性能。
智能体蒙特卡洛:黑盒智能体的强化学习模拟
机构 * University of Cambridge(剑桥大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。
Comments Accepted by ICML 2026
半参数偏好优化:你的语言模型秘密地是一个单索引模型
机构 * Netflix & Cornell University(Netflix与康奈尔大学)
专题命中 后训练与偏好优化 :language model(title);preference optimization(title);分类 cs.AI、cs.LG
AI总结 本文提出半参数偏好优化方法,通过放宽偏好与潜在奖励之间的链接函数假设,在未知且无限制的链接函数下进行策略对齐,并证明策略类的可实现性诱导出半参数单索引二元选择模型,直接学习策略并给出链接无关的收敛保证。
EchoRL:通过回滚回响进行强化学习
机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) ; Huawei Heisenberg Research Center(华为海森堡研究所以) ; University of Arizona(亚利桑那大学) ; College of Computing(计算学院) ; Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) ; MemAgents Lab(MemAgents实验室)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对RLVR训练中优势退化问题,提出EchoRL模块,通过从成功回滚中提取EchoClip作为辅助监督信号,持续提升训练性能。
Comments ICML 2026
大型语言模型的对齐调优:以数据为中心的对齐数据管道视角
机构 * KAIST(韩国科学技术院)
专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。
Comments Accepted at the Findings of ACL 2026
GIFT: 组相对隐式微调整合GRPO与DPO和UNA
机构 * Inflection AI
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG
AI总结 GIFT结合GRPO组采样、DPO隐式奖励和UNA的隐式与显式优势MSE,通过z-score标准化消除DPO隐式奖励中的不可行分区函数Z(x)和RLHF/RLVR目标中的KL系数β,以组相对隐式微调解决相同参数策略族,用提示适应的β(x)替代外部调优的β。
P²O:联合策略和提示优化
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。
交替强化学习用于非可验证大语言模型后训练的评分标准建模
机构 * Emory University(埃默里大学) ; Purdue University(普渡大学) ; Rutgers University(罗格斯大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University at Albany(阿尔巴尼大学)
专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.CL、cs.LG
AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。
Comments The first two authors contributed equally
DARA: 通过基于上下文的决策制定实现在线广告中的少样本预算分配
机构 * Peking University(北京大学) ; School of Computer Science(计算机科学学院) ; Alibaba Group(阿里巴巴集团) ; Theta Labs, Inc.(Theta Labs公司)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 DARA通过结合LLMs的上下文学习与细粒度优化,实现在线广告中的少样本预算分配,提升广告商价值。
Comments Accepted at The ACM Web Conference (WWW) 2026
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)