arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4526 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4526 篇

2504.05294 2026-07-08 cs.CL 版本更新 84%

Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

真实还是编造?利用因果归因减轻解释中的奖励作弊

Pedro Ferreira, Wilker Aziz, Ivan Titov

机构 * Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学) Institute for Language, Cognition and Computation (ILCC), University of Edinburgh(语言、认知与计算研究所(ILCC),爱丁堡大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究大语言模型解释中因奖励模型导致的奖励作弊问题,提出用预测的因果归因丰富奖励模型输入的方法,该方法能减少大语言模型生成误导性解释的倾向,提升解释忠实度。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01964 2026-07-03 cs.CL 新提交 84%

Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing

超越有监督澄清:基于LLM的输入重写用于对话篇章解析

Yiming Liu, Ziyue Zhang, Zhichao Xu, Xin Yu, Yingheng Tang, Tianyu Jiang, Jie Cao

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。

Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16501 2026-06-16 cs.AI 新提交 84%

Post-Hoc Merging is Not Enough: Many-Shot Model Merging with Loss-Gap Balancing

事后合并是不够的:基于损失差距平衡的多轮模型合并

Kyungjin Im, Miru Kim, Chanin Eom, Minhae Kwon

机构 * Soongsil University, Republic of Korea(韩国顺斯大学) Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(成均馆大学电子与计算机工程系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出METIS方法,通过迭代多轮合并和任务损失差距加权,解决多任务模型合并中的信息擦除问题,显著提升最差任务性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11167 2026-06-10 cs.CL eess.AS 新提交 84%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08131 2026-06-09 cs.HC cs.AI 新提交 84%

LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

LCAM:诊断对话式AI中交互对齐失败的框架

Manuele Reani, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区管理学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 提出分层认知对齐模型(LCAM),通过五层对齐和两种失调极性诊断对话式AI的交互失败,应用于LLM咨询案例揭示潜在危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00291 2026-06-02 cs.GT cs.LG 84%

The Representation-Rationalizability Tradeoff in Reward Learning

奖励学习中的表示-可理性权衡

Jing Dong, Yaoliang Yu, Pascal Pourpart

机构 * Vector Institute(向量研究所) University of Waterloo(滑铁库大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文研究RLHF中奖励学习面临的表示与可理性之间的权衡,通过分解交叉熵损失为表示项和聚合项,证明更丰富的表示会扩大不可理性比较的数量,且联合训练无法自动达到最优平衡点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27996 2026-06-01 cs.AI 84%

Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

奖励偏差替代:单轴偏差缓解措施重定向优化压力

Max Lamparth, Daniel Fein, Andreas Haupt, Marcel Hussing, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。

Comments Improved readability (mostly appendix D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23244 2026-05-25 cs.LG 84%

Convex Optimization for Alignment and Preference Learning on a Single GPU

单GPU上的对齐与偏好学习的凸优化

Miria Feng, Mert Pilanci

机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17352 2026-05-19 cs.CL 84%

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

AMATA: 适应性多智能体轨迹对齐用于知识密集型问答

Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Shanghai University of Electric Power(上海电力大学) East China Normal University(华东师范大学) Guangdong University of Finance and Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本研究提出AMATA框架,通过动态整合外部知识提高知识密集型问答的响应可解释性和事实准确性,采用六个专门化智能体协作执行复杂问题推理,并引入两种创新:轨迹内偏好学习和智能体间依赖学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG 84%

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06062 2026-05-18 cs.CL 84%

When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL

重要采样误分配信用:用于结果监督强化学习的非对称比率

Jiakang Wang, Runze Liu, Qingpeng Cai, Lei Lin, Wenping Hu, Xiu Li, Fuzheng Zhang, Guorui Zhou, Kun Gai, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12406 2026-05-13 cs.AI 84%

Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems

语义奖励崩溃与自适应AI系统中知识完整性保护

William Parris

机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。

Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01202 2026-05-13 cs.IT cs.AI math.IT 84%

Forget BIT, It is All about TOKEN: Towards Semantic Information Theory for LLMs

忘掉BIT,一切关于TOKEN:面向大语言模型的语义信息理论

Bo Bai

机构 * Bo Bai(白波)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出语义信息理论,将TOKEN作为意义载体,重构注意力机制和Transformer模型,建立预训练、强化学习和推理中的信息度量方法,明确下一token预测与格兰杰因果推断的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00942 2026-05-05 cs.SE cs.LG 84%

PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation

基于PPO的代理流水线:自适应提示选择与测试用例生成

Gourisetty Venkata Sai Koushik, Dama Aditya, Mahankali Harish Sai, Peddi Siddarhta, Shadab Ahmad, Vivek Yelleti

机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出一种基于强化学习的代理框架,利用PPO与LLM生成测试用例,通过自适应提示选择提升代码覆盖率。实验表明PPO-LLM在分支和行覆盖率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02261 2026-04-20 cs.IR cs.LG 84%

What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context

是什么让大语言模型(LLMs)成为有效的序列推荐者?对偏好强度和时间上下文的研究

Zhongyu Ouyang, Qianlong Wen, Chunhui Zhang, Yanfang Ye, Soroush Vosoughi

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) ByteDance, US(字节跳动(美国)) Department of Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文研究了LLMs在序列推荐中有效性的关键因素,提出RecPO框架通过整合显式和隐式反馈,提升推荐性能,强调偏好强度和时间上下文的重要性。

Comments Accepted The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09780 2026-04-15 cs.LG 84%

Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO

向小偷致敬:探索去中心化GRPO中的攻击与防御

Nikolay Blagoev, Oğuzhan Ersoy, Lydia Yiyu Chen

机构 * Gensyn Université de Neuchâtel(Neuchâtel大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究去中心化GRPO的鲁棒性,提出首个对抗攻击及防御措施,通过恶意节点污染良性模型,展示攻击成功率可达100%,并提出两种防御机制以减轻攻击影响。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02507 2026-04-06 stat.ML cs.LG 84%

Reinforcement Learning from Human Feedback: A Statistical Perspective

基于人类反馈的强化学习:统计学视角

Pangpang Liu, Chengchun Shi, Will Wei Sun

机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计学系) Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文从统计学角度探讨了基于人类反馈的强化学习,分析了其在大语言模型对齐中的核心方法与挑战,包括奖励模型学习和策略优化,并讨论了相关统计模型和最新研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14400 2026-03-23 cs.AI 84%

HPS: Hard Preference Sampling for Human Preference Alignment

HPS: 人类偏好对齐的硬偏好采样

Xiandong Zou, Wanyu Lin, Yuchen Li, Pan Zhou

机构 * Singapore Management University(新加坡国立管理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出HPS框架,通过优先选择最受好评的响应并拒绝所有不受欢迎和有害的响应,提升大语言模型与人类偏好的对齐效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05933 2026-02-06 cs.LG 84%

Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练

Zhenghao Xu, Qin Lu, Changlong Yu, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.LG

AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04346 2025-10-24 cs.CL 84%

Permutative Preference Alignment from Listwise Ranking of Human Judgments

Yang Zhao, Yixin Wang, Mingzhang Yin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Florida(佛罗里达大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Published at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 84%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06124 2025-08-11 cs.CL 84%

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models

Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee, Rima Hazra, Somak Aditya, Animesh Mukherjee

专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02193 2025-07-29 cs.AI 84%

More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment

Yifan Wang, Runjin Chen, Bolian Li, David Cho, Yihe Deng, Ruqi Zhang, Tianlong Chen, Zhangyang Wang, Ananth Grama, Junyuan Hong

机构 * Purdue University(普渡大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

Comments This version includes updated results and expanded discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02686 2025-06-13 cs.CL 84%

Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards

Xiaobao Wu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16265 2025-05-23 cs.LG 84%

Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models

Ilgee Hong, Changlong Yu, Liang Qiu, Weixiang Yan, Zhenghao Xu, Haoming Jiang, Qingru Zhang, Qin Lu, Xin Liu, Chao Zhang, Tuo Zhao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17112 2025-04-01 cs.LG 84%

Decoding Human Preferences in Alignment: An Improved Approach to Inverse Constitutional AI

Carl-Leander Henneking, Claas Beger

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 9 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17401 2025-03-04 cs.LG stat.ML 84%

Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference

Qining Zhang, Lei Ying

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19798 2025-02-28 cs.AI 84%

Developmental Support Approach to AI's Autonomous Growth: Toward the Realization of a Mutually Beneficial Stage Through Experiential Learning

Taichiro Endo

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

Comments 4pages, 3 figures

Journal ref Proc. 1st Workshop on Post-Singularity Symbiosis, PSS-2025-007, March 3, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11284 2025-02-18 cs.LG 84%

Balancing the Budget: Understanding Trade-offs Between Supervised and Preference-Based Finetuning

Mohit Raghavendra, Junmo Kang, Alan Ritter

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14723 2025-02-11 cs.CL 84%

Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks

Amir Saeidi, Shivanshu Verma, Md Nayem Uddin, Chitta Baral

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏