MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
专题命中 后训练与偏好优化 :language model(title,abstract)
专题命中 后训练与偏好优化 :language model(title,abstract)
Comments accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF
专题命中 后训练与偏好优化 :post-training(title,abstract)
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments Accepted to CVPR2023
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments WWW 2023, 12 pages
专题命中 后训练与偏好优化 :preference optimization(title,abstract)
Comments 8 page main text, 2 page appendix, 5 figures
专题命中 后训练与偏好优化 :post-training(title,abstract)
Comments ECCV2022
专题命中 后训练与偏好优化 :post-training(title,abstract)
Agent Lightning v1.0:走向可控的智能体强化学习
机构 * Microsoft(微软) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; University of Edinburgh(爱丁堡大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
过度自信且忽视细节:通过归纳偏好学习修复提示不敏感
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Northeastern University(东北大学) ; Uniphore(Uniphore公司)
专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL
AI总结 本文提出归纳偏好学习方法,通过优化归纳策略提升模型对罕见提示的敏感度,显著提高在VLMBias和Inverse-IFEval基准测试中的性能。
Comments 26 pages, 15 tables, 3 figures
DHRCL:使用密集分层奖励与课程学习训练代码大语言模型
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出DHRCL框架,通过分层奖励与自动阶段课程学习训练代码大语言模型,经多模型规模实验验证其优势稳定,优于多种基线方法。
超越以解决方案为中心的搜索:面向自主机器学习工程的自适应查询与知识修正
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 该研究针对自主机器学习工程的长时任务,提出信息范式并实现为Iris智能体,其在MLE-Bench上12小时预算下获64.9%任意奖牌率,还具备跨领域泛化能力。
OBLR-PO:大型语言模型后训练稳定强化学习的理论框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 OBLR-PO通过理论框架优化学习率和基线,提升大型语言模型后训练的稳定性与性能。
Comments 28 pages, 16 figures
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。
LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
让我看着你:用于对话语音合成的高级面部表情建模
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。
Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026
学习扩散模型的采样参数
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。
Comments Code will be released
TeaRAG:一种令牌高效的智能检索增强生成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI
AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。
Comments 34 pages
PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架
机构 * School of Mathematics, Hunan University(湖南大学数学学院) ; College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。
Comments 13 pages, 3 figures
一个样本就能带偏所有:单次GRPO打破对齐
机构 * University of Michigan(密歇根大学) ; Northwestern University(西北大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。
Comments COLM 2026
用于微调离散扩散模型的连续时间强化学习框架
机构 * Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。
Comments 36 pages, 5 figures
SD-MAR:通过合成数据和强化学习进行多图像分析推理
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; AGI Foundations for AWS(AWS的通用人工智能基金会) ; Amazon Web Services (AWS)(亚马逊网络服务公司)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。
重新思考多领域测试时扩展的奖励模型
机构 * KAIST(韩国科学技术院) ; Microsoft Research Asia(微软亚洲研究院) ; TH Nürnberg
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。
思维种子:在语言模型中利用历史多样性进行位置感知强化学习
机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院 TJUNLP 实验室)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 研究语言模型在线强化学习问题,提出思维种子这一令牌级混合策略框架,利用模型历史检查点作离线前缀,通过令牌级重要性比率有效利用历史多样性,实验表明其性能优于标准在线训练和现有离线扩展。
对齐音频字幕与人类偏好
机构 * Qualcomm Technologies, Inc.(高通技术公司)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract);分类 cs.LG
AI总结 提出基于人类反馈强化学习的音频字幕生成框架,通过CLAP奖励模型微调基线系统,无需真实标注即可生成更符合人类偏好的字幕。
Comments This paper has been accepted to INTERSPEECH 2026
积极对齐:人工智能促进人类繁荣
机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) ; Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) ; Google DeepMind(谷歌DeepMind) ; LIFE ; OpenAI ; Anthropic ; University of California, Los Angeles(加州大学洛杉矶分校) ; Aily Labs(Aily实验室) ; Stanford University(斯坦福大学) ; Tufts University(塔夫茨大学) ; Positive AI Labs(积极AI实验室) ; Department of Informatics, University of Sussex(Sussex大学信息学系) ; Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。
Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法
机构 * Stanford University(斯坦福大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Microsoft(微软公司)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。
Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)
Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026