Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments Accepted by AAAI 2024
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments Accepted to EMNLP 2023
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。
FORGE-plus:使用冻结的语言模型监督器进行力预算的富接触装配恢复
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究在规定力上限下实现紧间隙装配及从插入失败中恢复的问题,提出含冻结大语言模型的两层框架,该模型分配力上限并选恢复策略,通过实验评估,此框架表现良好,解决了部分夹具故障问题,也有负面结果。
结构化输出会削弱44种语言模型的答案多样性
机构 * Cornell Tech(康奈尔理工学院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。
Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。
通过偏好之上的偏好进行自适应边际基于人类反馈的强化学习
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究在基于人类反馈的强化学习中奖励模型学习的边际优化问题,提出利用偏好之上的偏好推断自适应边际,介绍具体实例DPO-PoP,提升判别和生成性能,并给出采样策略。
更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; OPPO AI Center(OPPO AI中心)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。
灵活性陷阱:重新思考扩散语言模型中任意顺序的价值
机构 * LeapLab, Tsinghua University(清华大学Leap实验室) ; NLPLab, Tsinghua University(清华大学自然语言处理实验室) ; Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团) ; BNRist, Tsinghua University(清华大学北京研究院)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。
Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO
P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉
机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) ; Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) ; Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。
扩散语言模型是好的数据库分析师吗?
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 本文提出统一评估框架和SQL-D1智能体框架,通过实验证明扩散语言模型在NL2SQL任务中具有结构鲁棒性和效率-精度灵活权衡的优势。
TPMM-DPO:轨迹感知偏好引导的模型合并用于迭代直接偏好优化
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对迭代DPO中噪声累积导致的过优化和性能退化问题,提出TPMM-DPO方法,通过将迭代策略模型序列视为优化轨迹并自适应融合,构建更平滑鲁棒的参考模型,从而提升训练稳定性和生成质量。
Comments 11 pages,6 figures
DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习
机构 * The Ohio State University(俄亥俄州立大学) ; Apple(苹果公司)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。
基于熵的奖励引导用于扩散语言模型对齐
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。
Comments Preprint
你的语言模型就是其自身的批评者:具有从演员内部状态估计价值的强化学习
机构 * Graduate School of Data Science(数据科学研究生院) ; Seoul National University(首尔国立大学) ; Computer Science and Engineering(计算机科学与工程)
专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出POISE方法,通过利用策略模型内部信号在强化学习中实现高效的基线估计,减少方差并提高训练稳定性,适用于数学推理任务。
Comments Under Review; Project Page: https://elijah0430.github.io/poise/
竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn)
AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。
RAD-DPO:面向电商生成检索的鲁棒自适应去噪直接偏好优化
专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn)
AI总结 针对生成检索中直接偏好优化的局限性,提出RAD-DPO方法,通过梯度分离保护前缀结构、动态奖励加权缓解标签噪声、全局对比学习扩展正样本覆盖,提升检索精度和训练效率。
通过定向偏好优化减少长上下文监管理解中的细节幻觉
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。
Comments 16 pages, 4 figures
并非所有回放都有效:在大语言模型强化学习中的回放下采样
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。
Comments 19 pages, 10 figures, TMLR 2026
在微调后输出多样性为何会崩溃?
机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。
GIFT:通过有限温度吉布斯初始化调和后训练目标
机构 * Peking University(北京大学) ; Meituan(美团)
专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。
AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。
OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成
机构 * Korea University(韩国大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。
Comments 11 pages, 6 figures
自适应Alpha加权与PPO:增强量化交易中基于提示的LLM生成Alpha
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出利用PPO优化LLM生成的Alpha权重,以提升量化交易策略的风险调整后表现。
Comments This paper has been accepted by International Journal of Data Science and Analytics
逆强化学习与动态奖励缩放用于大语言模型对齐
机构 * Beijing Electronic Science and Technology Institute(北京电子科技学院) ; Alibaba Group(阿里巴巴集团) ; Nanjing University(南京大学) ; Duke University(杜克大学) ; BraneMatrix AI ; Renmin University of China(中国人民大学) ; Northeast University(东北大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang Lab(浙江实验室) ; Sun Yat-sen University(中山大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DR-IRL通过动态奖励缩放和逆强化学习提升大语言模型的安全对齐性能,有效解决数据不平衡和静态奖励模型的局限性。
Rank-GRPO: 基于强化学习训练基于大语言模型的对话推荐系统
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 Rank-GRPO通过两阶段框架提升LLM对话推荐系统的训练效果,解决排名质量下降问题。
LongVPO:从锚定线索到自我推理的长视频偏好优化
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; JIUTIAN Research(Jiutian研究) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。
Comments NeurIPS 2025
SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化
机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) ; Alibaba Group, China(阿里集团,中国)
专题命中 后训练与偏好优化 :LLM(title);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。
Comments 39 pages, 15 figures, 16 tables, 60 equations