arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4489 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4489 篇

2511.04393 2026-06-01 cs.AI 92%

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28010 2026-05-28 cs.AI 92%

Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback

信心编排的自我进化:应对不确定的LLM反馈

Bowen Wei, Nan Wang, Yuqing Zhou, Jinhao Pan, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出COSE方法,利用LLM内在置信度作为不确定性信号,通过置信度加权PPO更新和置信度优先重放,在通用推理和数学任务上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01523 2026-05-19 cs.LG stat.ML 92%

Beyond RLHF: A Unified Theoretical Framework of Alignment

超越RLHF:对齐的统一理论框架

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

机构 * KRAFTON UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) POSTECH

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种统一的对齐理论框架,通过将对齐视为基于成对偏好的分布学习,推导出三种新的对齐目标,并证明了它们在非渐近情况下具有O(1/n)的收敛性,为RLHF提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19265 2026-03-24 cs.CL 92%

Difficulty-Controllable Multiple-Choice Question Generation Using Large Language Models and Direct Preference Optimization

基于大语言模型和直接偏好优化的难度可控多选题生成

Yuto Tomikawa, Masaki Uto

机构 * Graduate School of Informatics and Engineering, University of Electro-Communications(信息与工程研究生学校,电通大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型和直接偏好优化的多选题生成方法,解决传统方法无法生成多选题和优化难度控制的问题。

Comments Accepted for publication in IEEE Access. Please refer to the published version for the final content. DOI: 10.1109/ACCESS.2026.3674595

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10279 2026-03-12 cs.LG 92%

Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF

生成推荐系统的鲁棒性训练:为何指数奖励加权SFT优于RLHF

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(title,abstract);RLHF(title,abstract);分类 cs.LG

AI总结 本文提出指数奖励加权SFT方法,通过直接优化观测奖励,有效解决生成推荐系统中的鲁棒性训练问题,理论和实验证实其在噪声环境下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24781 2025-09-30 cs.CL 92%

SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models

Jun Rao, Yunjie Liao, Xuebo Liu, Zepeng Lin, Lian Lian, Dong Jin, Shengjun Cheng, Jun Yu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(计算与智能学院,哈尔滨工业大学,深圳) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院,哈尔滨工业大学,深圳)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16261 2025-08-25 cs.LG 92%

On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View

Tao Guo, Junxiao Wang, Fushuo Huo, Laizhong Cui, Song Guo, Jie Gui, Dacheng Tao

机构 * Shenzhen University(深圳大学) Guangzhou University(广州大学) PolyU HKUST(香港科技大学) Southeast University(东南大学) NTU(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12999 2025-06-17 cs.CL 92%

POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization

Batuhan K. Karaman, Ishmam Zabir, Alon Benhaim, Vishrav Chaudhary, Mert R. Sabuncu, Xia Song

机构 * Cornell University(康奈尔大学) Microsoft(微软公司) Meta

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02460 2025-06-04 cs.CL 92%

MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework

Yupeng Qi, Ziyu Lyu, Min Yang, Yanlin Wang, Lu Bai, Lixin Cui

机构 * Sun Yat-sen University(中山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院、中国科学院) Beijing Normal University(北京师范大学) Central University of Finance and Economics(中央财经大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17928 2025-03-25 cs.CV cs.CL 92%

Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization

Zefeng Zhang, Hengzhu Tang, Jiawei Sheng, Zhenyu Zhang, Yiming Ren, Zhenyang Li, Dawei Yin, Duohe Ma, Tingwen Liu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06221 2024-11-12 cs.CR cs.AI cs.SE 92%

Smart-LLaMA: Two-Stage Post-Training of Large Language Models for Smart Contract Vulnerability Detection and Explanation

Lei Yu, Shiqi Chen, Hang Yuan, Peng Wang, Zhirong Huang, Jingyuan Zhang, Chenjie Shen, Fengjun Zhang, Li Yang, Jiajia Ma

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03728 2024-08-08 cs.LG math.OC 92%

A Convex-optimization-based Layer-wise Post-training Pruner for Large Language Models

Pengxiang Zhao, Hanyu Hu, Ping Li, Yi Zheng, Zhefeng Wang, Xiaoming Yuan

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09217 2026-08-11 cs.LG cs.AI 新提交 91%

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验

Ting Zhou, Zhenqing Ling, Daoyuan Chen, Qianli Shen, Yilun Huang, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 91%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19139 2026-07-07 cs.CL cs.AI 版本更新 91%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn)

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25447 2026-06-25 cs.LG cs.CL 新提交 91%

The Interplay of Harness Design and Post-Training in LLM Agents

马具设计与后训练在LLM智能体中的相互作用

Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 研究将马具(工具集成脚手架)作为可控设计维度,分析其对后训练的影响,发现马具感知的后训练能提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04773 2026-06-25 cs.LG cs.AI 版本更新 91%

Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning

分布偏好优化:大语言模型遗忘的细粒度视角

Kai Qin, Jiaqi Wu, Jianxiang He, Haoyuan Sun, Yifei Zhao, Xu Wang, Bin Liang, Yongzhe Chang, Cheng Li, Tiantian Zhang, Houde Liu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Jianghuai Advanced Technology Center(江淮先进技术中心) University of Technology Sydney(悉尼大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型遗忘中负偏好优化缺乏显式正信号的问题,提出分布偏好优化(DiPO),通过选择性放大或抑制模型高置信度输出logits构建偏好分布对,实现细粒度遗忘,在TOFU和MUSE基准上取得最优遗忘质量与模型效用的平衡。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04913 2026-06-09 cs.CL cs.LG 版本更新 91%

Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

重新思考局部学习:一种更便宜更快的LLM后训练配方

Hengyu Shi, Tianyang Han, Peizhe Wang, Zhiling Wang, Xu Yang, Junhao Su

机构 * Independent Researcher(独立研究者) D 4 Lab(D4实验室) Southeast University(东南大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoPT,一种局部学习后训练策略,通过在transformer中点设置梯度边界,降低内存成本,提高训练效率并保留预训练能力。

Comments 35pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30808 2026-06-01 cs.CR cs.AI cs.LG 91%

Differentially Private Preference Data Synthesis for Large Language Model Alignment

面向大语言模型对齐的差分隐私偏好数据合成

Fengyu Gao, Jing Yang

机构 * Department of Computer Science, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学计算机科学系) Department of Electrical and Computer Engineering, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学电气与计算机工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 提出DPPrefSyn算法,基于Bradley-Terry偏好模型和DP-PCA生成差分隐私合成偏好数据,实现隐私保护的偏好对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08565 2026-05-15 cs.CL cs.AI cs.CY 91%

Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models

道德敏感性与在角色扮演下大型语言模型的鲁棒性

Davi Bastos Costa, Felippe Alves, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文研究了大型语言模型在角色扮演下的道德反应,通过道德基础问卷基准测试,量化了道德敏感性和鲁棒性,揭示了模型家族对鲁棒性的影响显著,而预训练对敏感性起主导作用。

Comments Added experiments with a logit-based method and now reporting unbounded metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05415 2026-05-08 cs.LG cs.AI cs.CR 91%

Information Theoretic Adversarial Training of Large Language Models

信息论视角下的大语言模型对抗训练

Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi, Rouzbeh Behnia, Jason Pacheco, Elisa Bertino

机构 * Purdue University(普渡大学) Texas State University(德克萨斯州立大学) University of South Florida(佛罗里达州立大学) University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);preference optimization(abstract)

AI总结 本文提出WARDEN框架,通过信息论方法动态调整对抗示例权重,提升大语言模型的鲁棒性,减少攻击成功率且保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11079 2026-04-28 cs.LG cs.AI 91%

Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training

基于探针的数据归因:发现并缓解LLM微调后的不良行为

Frank Xiao, Santiago Aranguri

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV 91%

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07070 2025-11-11 cs.AI cs.LG 91%

RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services

Fei Zhao, Chonggang Lu, Haofu Qian, Fangcheng Shi, Zijie Meng, Jianzhao Huang, Xu Tang, Zheyong Xie, Zheyu Ye, Zhe Xu, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc.(小红书研究院自然语言处理团队)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10605 2025-10-14 cs.LG cs.AI cs.SI 91%

RedOne: Revealing Domain-specific LLM Post-Training in Social Networking Services

Fei Zhao, Chonggang Lu, Yue Wang, Zheyong Xie, Ziyan Liu, Haofu Qian, JianZhao Huang, Fangcheng Shi, Zijie Meng, Hongcheng Guo, Mingqian He, Xinze Lyu, Yiming Lu, Ziyang Xiang, Zheyu Ye, Chengqiang Lu, Zhe Xu, Yi Wu, Yao Hu, Yan Gao, Jun Fan, Xiaolong Jiang, Weiting Liu, Boyang Wang, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc.(小红书公司自然语言处理团队)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21963 2025-05-29 cs.CL cs.AI 91%

LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents

Taro Yano, Yoichi Ishibashi, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05704 2025-05-12 cs.CL cs.AI 91%

Assessing Robustness to Spurious Correlations in Post-Training Language Models

Julia Shuieh, Prasann Singhal, Apaar Shanker, John Heyer, George Pu, Samuel Denton

机构 * Scale AI

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);large language model(abstract);SFT(abstract)

Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16615 2025-04-10 cs.IR cs.CL cs.LG 91%

Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval

Luo Ji, Feixiang Guo, Teng Chen, Qingqing Gu, Xiaoyu Wang, Ningyuan Xi, Yihong Wang, Peng Yu, Yue Zhao, Hongyang Lei, Zhonglin Jiang, Yong Chen

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments 10 pages, 3 figures, ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18480 2025-02-27 cs.IR cs.AI cs.CL 91%

QExplorer: Large Language Model Based Query Extraction for Toxic Content Exploration

Shaola Ren, Li Ke, Longtao Huang, Dehong Gao, Hui Xue

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15453 2024-12-23 cs.CL cs.AI 91%

Northeastern Uni at Multilingual Counterspeech Generation: Enhancing Counter Speech Generation with LLM Alignment through Direct Preference Optimization

Sahil Wadhwa, Chengtian Xu, Haoming Chen, Aakash Mahalingam, Akankshya Kar, Divya Chaudhary

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments 10 pages, 6 tables, 1 figure, The First Workshop on Multilingual Counterspeech Generation (MCG) at The 31st International Conference on Computational Linguistics (COLING 2025)

Journal ref The First Workshop on Multilingual Counterspeech Generation (MCG) at The 31st International Conference on Computational Linguistics (COLING 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏