arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4482 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4482 篇

2608.10823 2026-08-12 cs.LG 新提交 93%

MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

用于LLM RL后训练中低成本故障复现与诊断的MoE代理模型

Yikai Wang, Chuansai Zhou, Yuhang Zhou, Weiqiang Wu, Cong Wu, Yue Deng, Ben Feng, Mingming Zhu, Beirong Zhou, Zhibin Wang, Sheng Zhong, Chen Tian, Wangze Zhang

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对LLM RL后训练中故障复现成本高的问题,提出一种MoE代理模型构建方法,通过专家剪枝降低计算需求,可低成本复现故障并辅助诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19741 2026-03-23 cs.LG cs.CL 93%

FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment

FedPDPO:联邦个性化直接偏好优化用于大语言模型对齐

Kewen Zhu, Liping Yi, Zhiming Zhao, Zhuang Qi, Han Yu, Qinghua Hu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出FedPDPO,一种联邦个性化直接偏好优化框架,通过参数高效微调和个性化奖励头解决非iid数据下的大语言模型对齐问题,实验显示在联邦内域和跨域设置中平均准确率提升达4.80%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09621 2026-02-12 cs.CL cs.LG 93%

AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models

AlignTune: 大型语言模型后训练对齐的模块化工具包

R E Zera Marveen Lyngkhoi, Chirag Chawla, Pratinav Seth, Utsav Avaiya, Soham Bhattacharjee, Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);SFT(abstract)

AI总结 AlignTune通过模块化工具包提供统一接口,支持监督微调和RLHF优化,解决后端干扰和不可复现问题,提升对齐研究的可控性和复现性。

Comments Library opensource and available at https://github.com/Lexsi-Labs/aligntune

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17126 2025-03-24 cs.CL cs.LG 93%

Modifying Large Language Model Post-Training for Diverse Creative Writing

John Joon Young Chung, Vishakh Padmakumar, Melissa Roemmele, Yuqian Sun, Max Kreminski

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12741 2024-12-16 cs.CL cs.AI 93%

Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization

Thomas Savage, Stephen Ma, Abdessalem Boukil, Vishwesh Patel, Ekanath Rangan, Ivan Lopez, Jonathan H Chen

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11490 2023-04-27 cs.AI cs.CL 93%

Boosting Theory-of-Mind Performance in Large Language Models via Prompting

Shima Rahimi Moghaddam, Christopher J. Honey

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 27 pages, 4 main figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08058 2026-08-11 cs.CY 新提交 93%

Representational Equality in Cross-country Value Simulation: A Systematic Analysis of Large Language Models

跨国价值观模拟中的表征平等:对大型语言模型的系统分析

Xiaowen Jian, Xinyi Mou, Daisong Gong, Chen Qian, Huimin Chen, Maosong Sun

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本研究分析59国的LLM跨国价值观模拟,发现富裕技术先进国家人群模拟更准确,且两种干预路径的准确率提升未必带来表征平等,为构建更具包容性的LLM模拟提供指导。

Comments Accepted for publication in Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18388 2026-06-18 cs.LG cs.AI cs.CL cs.MA 新提交 93%

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

LLMZero: 通过LLM智能体发现RL后训练的自适应训练策略

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, Xuan Zhu, Huzefa Rangwala, George Karypis, Bernie Wang

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLMZero系统,利用LLM智能体通过树搜索发现多阶段RL后训练的自适应策略,揭示容量参数单调累积、正则化参数振荡的规律,在4个GRPO任务上相对基线提升9%-140%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27354 2026-05-27 cs.LG cs.AI cs.CL 93%

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

利用稀疏自编码器的模型内部状态指导LLM后训练数据工程

Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出SAERL框架,通过稀疏自编码器提取模型内部状态,建模数据多样性、难度和质量,用于强化学习数据工程,提升准确率并减少训练步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28301 2026-07-31 cs.LG 新提交 93%

HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化

Tiangang Li, Xiangbo Tian

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11483 2026-05-13 cs.CL 93%

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐

Ishmam Khan, Sindhuja Thogarrati, Shuo Zhang

机构 * Tufts University(塔夫茨大学) Bose Corporation(博世公司)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);small language model(title);LLM(abstract_cn)

AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08730 2024-04-04 cs.CL cs.CV 93%

Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization

Renjie Pi, Tianyang Han, Wei Xiong, Jipeng Zhang, Runtao Liu, Rui Pan, Tong Zhang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02391 2026-08-04 cs.AI cs.LG 新提交 93%

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

资源受限智能体大语言模型后训练的协同协同进化方法

Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang, Shaofeng Zhang, Haoze Lv, Ke Tang

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。

Comments 14 pages,9 figures, submit to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 93%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);preference optimization(abstract)

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31309 2026-07-01 cs.CR cs.AI cs.LG 新提交 93%

CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs

CSO-LLM:用于LLM训练后后门检测与触发器反转的类子空间正交化

Zhengxing Li, David J. Miller, Guangmingmei Yang, George Kesidis

机构 * Penn State University(宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CSO框架,通过类子空间正交化增强LLM后门检测的敏感性和特异性,并实现隐式黑名单功能,在连续和离散空间中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 93%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);post-training(title);LLM(abstract,abstract_cn)

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06337 2026-08-06 cs.CL cs.AI cs.LG 版本更新 93%

Can Post-Training Transform LLMs into Causal Reasoners?

训练后能否将大语言模型转变为因果推理者?

Junqi Chen, Sirui Chen, Chaochao Lu

机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11050 2026-06-10 cs.MA cs.GT cs.SY eess.SY 新提交 93%

LLM-Mediated Demand Response Coordination in Smart Microgrids

LLM介导的智能微电网需求响应协调

J. de Curtò, I. de Zarzà

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。

Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29782 2026-05-29 cs.LG cs.AI cs.CL 93%

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

Hista 和 Numca:为 LLM 强化学习有效估计状态值

Zizhe Chen, Jiqian Dong, Yizhou Tian, Garry Yang, Yongqiang Chen, Zhitang Chen, James Cheng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对 LLM 强化学习中状态值估计不准确的问题,提出 Numca(利用数值跨度作为可分级里程碑)和 Hista(利用隐藏状态加权平均不连续轨迹及其回报)两种方法,显著提升估计精度和训练性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 93%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09259 2026-03-19 cs.CL cs.AI cs.LG 93%

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14088 2025-04-25 cs.DC cs.AI cs.CL cs.LG 93%

ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation

Zhiyu Mei, Wei Fu, Kaiwei Li, Guangju Wang, Huanchen Zhang, Yi Wu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);LLM(abstract)

Comments 11 pages (20 pages with references and the appendix), 17 figures. Accepted by MLSys 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00530 2025-01-09 cs.CL cs.AI cs.LG 93%

Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization

Hritik Bansal, Ashima Suvarna, Gantavya Bhatt, Nanyun Peng, Kai-Wei Chang, Aditya Grover

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

Comments 22 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02939 2024-12-24 cs.CL cs.AI cs.LG 93%

A Post-Training Enhanced Optimization Approach for Small Language Models

Keke Zhai

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11523 2024-10-16 cs.LG cs.AI cs.CL 93%

Group Preference Optimization: Few-Shot Alignment of Large Language Models

Siyan Zhao, John Dang, Aditya Grover

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

Comments accepted at ICLR 2024, code at https://github.com/jamqd/Group-Preference-Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06293 2024-10-10 cs.LG cs.AI cs.CL 93%

Accelerated Preference Optimization for Large Language Model Alignment

Jiafan He, Huizhuo Yuan, Quanquan Gu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);RLHF(abstract)

Comments 44 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11839 2024-10-08 cs.CV cs.AI cs.CL cs.LG 93%

mDPO: Conditional Preference Optimization for Multimodal Large Language Models

Fei Wang, Wenxuan Zhou, James Y. Huang, Nan Xu, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

Comments Accepted to EMNLP 2024 Main Conference. Project website: https://feiwang96.github.io/mDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04283 2024-03-08 cs.CL cs.AI cs.LG 93%

Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy

Yu Zhu, Chuxiong Sun, Wenfei Yang, Wenqiang Wei, Bo Tang, Tianzhu Zhang, Zhiyu Li, Shifeng Zhang, Feiyu Xiong, Jie Hu, Mingchuan yang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04964 2023-07-19 cs.CL cs.AI cs.LG 93%

Secrets of RLHF in Large Language Models Part I: PPO

Rui Zheng, Shihan Dou, Songyang Gao, Yuan Hua, Wei Shen, Binghai Wang, Yan Liu, Senjie Jin, Qin Liu, Yuhao Zhou, Limao Xiong, Lu Chen, Zhiheng Xi, Nuo Xu, Wenbin Lai, Minghao Zhu, Cheng Chang, Zhangyue Yin, Rongxiang Weng, Wensen Cheng, Haoran Huang, Tianxiang Sun, Hang Yan, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11082 2026-06-10 cs.CL cs.CY 新提交 92%

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

示播列效应:审计大型语言模型的跨语言分布偏斜

Hakan Mehmetcik

机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) Marmara University(马尔马拉大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn)

AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。

Comments 25 pages, 2 figures, 6 tables, Research Article

详情

展开后加载摘要…

URL PDF HTML 收藏