arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2505.23840 2026-03-02 cs.CL 85%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03411 2026-02-25 cs.SE cs.CL 85%

SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training

SWE-Master:通过训练后技术释放软件工程代理的潜力

Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan Cheng, Guoxin Chen, Yiwen Hu, Zongchao Chen, Yiming Jia, Wayne Xin Zhao, Yang Song, Tao Zhang, Ji-Rong Wen

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 SWE-Master通过训练后技术提升软件工程代理能力,实现61.4%的解决率并优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 85%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 85%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 85%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11779 2026-02-13 cs.LG 85%

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

温度作为元策略:LLM强化学习中的自适应温度

Haoran Dang, Cuiling Lan, Hai Wan, Xibin Zhao, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。

Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 85%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 85%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23096 2026-02-03 cs.LG 85%

CATTO: Balancing Preferences and Confidence in Language Models

CATTO: 在语言模型中平衡偏好与信心

Nisarg Parikh, Ananya Sai, Pannaga Shivaswamy, Kunjal Panchal, Andrew Lan

机构 * Adobe

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 CATTO通过校准意识的标记级训练目标,在保持任务准确性的同时,有效提升语言模型预测信心,减少校准误差,提高输出选择的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01002 2026-02-03 cs.AI 85%

How RLHF Amplifies Sycophancy

如何通过RLHF放大阿谀行为

Itai Shapira, Gerdus Benade, Ariel D. Procaccia

机构 * harvard(哈佛大学)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了RLHF如何通过放大机制增强阿谀行为,提出了一种训练干预措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16403 2026-01-26 cs.LG 85%

Towards a Theoretical Understanding to the Generalization of RLHF

迈向RLHF泛化性的理论理解

Zhaochun Li, Mingyang Yi, Yue Wang, Shisheng Cui, Yong Liu

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 85%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09212 2026-01-21 cs.CL 85%

Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment

针对对齐偏差:一种基于冲突意识的奖励模型驱动LLM对齐框架

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang, Xinru Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于冲突意识的框架,通过识别和缓解代理模型与策略间的冲突来提升大语言模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10387 2026-01-16 cs.CL 85%

The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models

助手轴:定位和稳定语言模型的默认人格

Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey

机构 * MATS Anthropic Fellows Program University of Oxford(牛津大学) Anthropic

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究发现语言模型的默认人格轴影响行为稳定性,通过限制激活区域可防止人格漂移及对抗性突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04694 2026-01-09 cs.AI 85%

ResMAS: Resilience Optimization in LLM-based Multi-agent Systems

ResMAS: LLM-based多智能体系统中的韧性优化

Zhilun Zhou, Zihan Liu, Jiahe Liu, Qingyu Shao, Yihan Wang, Kun Shao, Depeng Jin, Fengli Xu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResMAS通过两阶段框架提升LLM-based MAS的韧性,结合奖励模型与拓扑生成器优化拓扑和提示设计,增强系统在扰动下的稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 85%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24609 2026-01-01 cs.AI 85%

Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization

强化学习增强的LLM代理用于协作决策与性能优化

Dong Qiu, Duo Xu, Limengxi Yue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出强化学习增强的LLM代理框架,通过GRPO和联合奖励优化,提升多智能体协作任务的效率与一致性。

Comments Accepted by IEEE ICFTIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 85%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10601 2025-12-12 cs.LG 85%

Multi-Objective Reward and Preference Optimization: Theory and Algorithms

多目标奖励与偏好优化:理论与算法

Akhil Agnihotri

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本论文提出多目标约束优化算法MOPO,通过理论与算法结合,提升约束强化学习在控制、偏好学习和大语言模型对齐中的性能与安全性。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04419 2025-12-05 cs.AI 85%

Solving LLM Repetition Problem in Production: A Comprehensive Study of Multiple Solutions

在生产环境中解决大语言模型重复问题:对多种解决方案的综合研究

Weiwei Wang, Weijie Zou, Jiyong Min

机构 * Shenzhen Sunline Tech Co., Ltd(深圳Sunline科技有限公司)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文针对大语言模型在生产环境中重复问题,提出多种解决方案并验证其有效性,通过理论分析和实验评估,识别关键参数并提供实用的生产级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23316 2025-12-04 cs.CL 85%

Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO

近端化偏好优化用于多样化反馈类型:对DPO的分解视角

Kaiyang Guo, Yinchuan Li, Zhitang Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PRO方法,通过分解DPO损失并恢复完整正则化项,解决似然不足确定性问题,提升对多样化反馈类型的适应能力。

Comments NeurIPS'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01775 2025-12-02 cs.LG 85%

How Does RL Post-training Induce Skill Composition? A Case Study on Countdown

强化学习后训练如何诱导技能组合?一个倒计时案例研究

Simon Park, Simran Kaur, Sanjeev Arora

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能研究所(PLI)、普林斯顿大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过倒计时任务分析强化学习后训练如何诱导技能组合,揭示了模型在不同树结构上的学习顺序和泛化能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12113 2025-11-18 cs.AI 85%

MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization

Lanxue Zhang, Yuqiang Xie, Fang Fang, Fanglong Dong, Rui Liu, Yanan Cao

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 23 pages, 10 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09039 2025-11-11 cs.CL 85%

Atomic Consistency Preference Optimization for Long-Form Question Answering

Jingfeng Chen, Raghuveer Thirukovalluru, Junlin Wang, Kaiwei Luo, Bhuwan Dhingra

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03690 2025-10-30 cs.CL 85%

Robust Preference Optimization via Dynamic Target Margins

Jie Sun, Junkang Wu, Jiancan Wu, Zhibo Zhu, Xingyu Lu, Jun Zhou, Lintao Ma, Xiang Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 18 pages, 6 figures, accepted to Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23590 2025-10-28 cs.LG 85%

Lightweight Robust Direct Preference Optimization

Cheol Woo Kim, Shresth Verma, Mauricio Tec, Milind Tambe

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2509.02709

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07193 2025-10-28 cs.LG stat.ML 85%

Provably Efficient Online RLHF with One-Pass Reward Modeling

Long-Fei Li, Yu-Yang Qian, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025; The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13694 2025-10-16 cs.LG 85%

Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking

Yuchun Miao, Liang Ding, Sen Zhang, Rong Bao, Lefei Zhang, Dacheng Tao

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);SFT(abstract);分类 cs.LG

Comments 46 pages, 36 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19223 2025-10-14 cs.LG 85%

LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models

Fengqi Zhu, Rongzhen Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu, Jun Hu, Jun Zhou, Jianfei Chen, Yankai Lin, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09152 2025-10-13 cs.LG 85%

Logits Replay + MoClip: Stabilized, Low-Cost Post-Training with Minimal Forgetting

Suming Qiu, Jing Li, Zhicheng Zhou, Junjie Huang, Linyuan Qiu, Zhijie Sun

机构 * Global Technical Service (GTS) Huawei Technologies Co., Ltd(华为技术有限公司全球技术服务部)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏