arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4489 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4489 篇

2603.06610 2026-05-25 cs.LG 92%

CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training

CapTrack: 大语言模型后训练中遗忘的多方面评估

Lukas Thede, Stefan Winzeck, Zeynep Akata, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究) Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Munich Center for Machine Learning (MCML), Technical University Munich(慕尼黑机器学习中心(MCML),慕尼黑技术大学) Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出CapTrack框架,通过行为分类和评估套件系统分析LLM后训练中的遗忘现象,发现遗忘不仅限于参数知识,还涉及鲁棒性和默认行为的显著漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22785 2026-04-28 cs.LG 92%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);RLHF(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13006 2026-06-12 cs.SD 新提交 92%

Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech

Emo-LiPO:基于LLM的文本到语音中细粒度情感强度控制的列表式偏好优化

Yihang Lin, Li Zhou, Congwei Cao, Dongchu Xie, Xiaoxue Gao, Chen Zhang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学) Shenzhen Research Institute of Big Data(深圳市大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出Emo-LiPO框架,将情感强度控制建模为学习排序问题,通过列表式偏好优化对齐文本与语音的情感强度,实现更忠实连续的情感表达,在ESD-plus数据集上显著提升情感准确性和强度可控性。

Comments Accepted by IJCAI 2026. Emotional TTS, Preference Optimization, Emotion Intensity Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07786 2026-08-11 cs.AI cs.LG 新提交 92%

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系

Yiwei Chen, Bingqi Shang, Sijia Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12843 2026-06-25 cs.LG cs.AI 版本更新 92%

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06139 2026-05-21 cs.LG cs.AI 92%

Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

列表式策略优化:基于组的RLVR作为LLM响应单纯形上的目标投影

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系) LLM Department, Tencent(腾讯LLM部门)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出列表式策略优化(LPO),通过显式执行目标投影来解构隐式目标,利用响应单纯形限制近端RL目标,并通过精确散度最小化进行策略投影,从而在多样推理任务和LLM基础上提升训练性能,同时保持优化稳定性和响应多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06977 2026-05-11 cs.LG cs.AI cs.IT math.IT stat.ML 92%

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

$f$-Divergence Regularized RLHF:采样两则与统一分析

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 92%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17866 2026-01-30 cs.LG cs.AI 92%

Understanding Post-Training Structural Changes in Large Language Models

理解大型语言模型的训练后结构变化

Xinyu He, Xianghui Cao

机构 * School of Automation, Southeast University, Nanjing, China(自动化学院,东南大学,南京,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 本研究通过SVD分析揭示了大型语言模型训练后参数空间的结构变化,发现奇异值缩放和奇异向量旋转机制,为理解训练后调节机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09555 2026-01-15 cs.CL cs.AI 92%

Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats

在微缩浮点格式下对大语言模型进行后训练量化评估

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu

机构 * Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文研究了在微缩浮点格式下大语言模型后训练量化的效果,发现MXFP8性能接近无损,而MXFP4存在显著精度损失,且格式兼容性对PTQ效果影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06108 2026-01-13 cs.AI cs.CL 92%

From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models

从RLHF到直接对齐:大型语言模型偏好学习的理论统一

Tarun Raheja, Nilay Pochhi

机构 * Independent Researchers(独立研究者)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);preference optimization(abstract)

AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19599 2025-10-28 cs.AI cs.LG 92%

GVPO: Group Variance Policy Optimization for Large Language Model Post-Training

Kaichen Zhang, Yuzhong Hong, Junwei Bao, Hongfei Jiang, Yang Song, Dingqian Hong, Hui Xiong

机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Zuoyebang Education Technology(佐业邦教育科技) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17637 2025-08-26 cs.CL cs.AI 92%

Weights-Rotated Preference Optimization for Large Language Models

Chenxu Yang, Ruipeng Jia, Mingyu Zheng, Naibin Gu, Zheng Lin, Siyuan Chen, Weichong Yin, Hua Wu, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);SFT(abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23371 2025-04-01 cs.CL cs.AI 92%

FeRG-LLM : Feature Engineering by Reason Generation Large Language Models

Jeonghyun Ko, Gyeongyun Park, Donghoon Lee, Kyunam Lee

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);preference optimization(abstract)

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00045 2024-07-31 cs.CL cs.LG 92%

Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization

Yuanpu Cao, Tianrong Zhang, Bochuan Cao, Ziyi Yin, Lu Lin, Fenglong Ma, Jinghui Chen

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05040 2026-08-06 cs.CR 新提交 92%

Private Direct Preference Optimization for LLM Alignment

面向大语言模型对齐的私有直接偏好优化

Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding

专题命中 后训练与偏好优化 :LLM(title,summary_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对DPO的隐私缺陷,提出PrivDPO方法,通过沿偏好轴添加校准随机性实现偏好隐私,在对齐基准和LLM上取得了更好的隐私-效用权衡。

Comments accepted for publication at CCS 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11026 2026-03-24 cs.LG cs.AI cs.CL 92%

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :SFT(title,abstract);RLHF(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13008 2024-12-20 cs.LG cs.AI cs.CL 92%

DavIR: Data Selection via Implicit Reward for Large Language Models

Haotian Zhou, Tingkai Liu, Qianli Ma, Yufeng Zhang, Jianbo Yuan, Pengfei Liu, Yang You, Hongxia Yang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08656 2026-06-09 cs.CL 新提交 92%

From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory

从玩家到大师:通过基于记忆的强化学习增强LLM代理的测试时学习

Yishuo Cai, Xingyu Guo, Xuancheng Huang, Jinhua Du, Can Huang, Wenxuan Huang, Wenhan Ma, Yuyang Hu, Aohan Zeng, Jie Tang, Xu Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Memopilot,一种通过多轮GRPO训练记忆更新过程来优化冻结LLM代理在测试时学习的方法,在多人博弈中显著提升Elo评分。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07340 2026-05-22 cs.LG 92%

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control

通过选择性几何控制重新审视LLM安全对齐的鲁棒性

Yonghui Yang, Wenjian Tao, Jilong Liu, Xingyu Zhu, Junfeng Fang, Weibiao Huang, Le Wu, Richang Hong, Tat-Sent Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) ST Engineering Ltd., Singapore(新加坡ST工程有限公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04214 2026-04-30 cs.CL 92%

Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards

教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化

Xia Zeng, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Fliggy Alibaba(飞猪阿里)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。

Comments accepted by ACL 2026 indusry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL 92%

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10416 2026-01-16 cs.AI 92%

LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models

LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐

Tiesunlong Shen, Rui Mao, Jin Wang, Heming Sun, Jian Zhang, Xuejie Zhang, Erik Cambria

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16455 2025-08-26 stat.ML cs.LG stat.ME 92%

On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization

Jiancong Xiao, Ziniu Li, Xingyu Xie, Emily Getzen, Cong Fang, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Peking University(北京大学) Joint corresponding authors(联合通讯作者)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);LLM(abstract)

Comments Accepted for publication in the Journal of the American Statistical Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04657 2025-04-08 cs.LG 92%

ACE-RLHF: Automated Code Evaluation and Socratic Feedback Generation Tool using Large Language Models and Reinforcement Learning with Human Feedback

Tasnia Rahman, Sathish A. P. Kumar, Sumit Jha, Arvind Ramanathan

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);LLM(abstract)

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11555 2025-02-18 cs.AI 92%

Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models

Yingshui Tan, Yilei Jiang, Yanshi Li, Jiaheng Liu, Xingyuan Bu, Wenbo Su, Xiangyu Yue, Xiaoyong Zhu, Bo Zheng

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08414 2024-11-05 cs.LG 92%

Discovering Preference Optimization Algorithms with and for Large Language Models

Chris Lu, Samuel Holt, Claudio Fanconi, Alex J. Chan, Jakob Foerster, Mihaela van der Schaar, Robert Tjarko Lange

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11212 2024-09-18 cs.CL 92%

Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization

Jianing Wang, Yang Zhou, Xiaocheng Zhang, Mengjiao Bao, Peng Yan

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00934 2024-04-04 cs.CL 92%

ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback

Zhenyu Hou, Yilin Niu, Zhengxiao Du, Xiaohan Zhang, Xiao Liu, Aohan Zeng, Qinkai Zheng, Minlie Huang, Hongning Wang, Jie Tang, Yuxiao Dong

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30406 2026-06-30 cs.CL cs.LG 92%

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

MOPD: 面向LLM后训练中能力集成的多教师同策略蒸馏

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo

机构 * Peking University(北京大学) LLM Core Xiaomi(小米大模型核心团队) University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出多教师同策略蒸馏(MOPD)范式,通过先训练领域专家再在学生自生成数据上蒸馏,消除暴露偏差并提供密集优化信号,在Qwen3-30B-A3B上优于多种基线,并已部署于工业级模型MiMo-V2-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏