arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2602.14169 2026-06-15 cs.LG cs.AI cs.CL 版本更新 88%

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

基于枢轴驱动重采样的LLM强化学习深度密集探索

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Baidu(百度)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型强化学习中探索效率低的问题,提出深度密集探索(DDE)策略,通过识别失败轨迹中的可恢复枢轴状态并局部密集重采样,结合双流优化目标,在数学推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11867 2026-06-11 cs.DC 新提交 88%

Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training

利用路由预见性实现RL后训练中微步级MoE负载均衡

Yuming Zhou, Haoyang Li, Sheng Lin, Yanfeng Zhao, Tong Zhao, Xupeng Miao, Jie Jiang, Fangcheng Fu, Bin Cui

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对MoE模型在RL后训练中微步级负载波动问题,提出ForeMoE系统,利用rollout阶段的可预见路由信息主动引导负载均衡,并采用分层规划器与传输引擎实现微步级重配置,在64 GPU上取得高达1.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25850 2026-05-26 cs.CL cs.AI cs.LG 88%

TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning

TIAR:基于轨迹信息的优势重加权用于大语言模型弃权学习

Muyu Pan, Shu Zhao, Nan Zhang, Philip Shin, Varun Parekh, Vijaykrishnan Narayanan, Rui Zhang

机构 * Department of Computer Science, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学系)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIAR方法,利用GRPO中的多条轨迹作为自然弃权信号,动态重加权弃权奖励,在六个评估类别中的五个上取得最优弃权F1分数,同时保持基线准确率。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10054 2026-05-26 cs.LG cs.AI cs.CL cs.CV 88%

Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs

Uni-DPO:大语言模型动态偏好优化的统一范式

Shangpin Peng, Weinong Wang, Zhuotao Tian, Senqiao Yang, Xing Wu, Haotian Xu, Chengquan Zhang, Takashi Isobe, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有DPO方法忽略数据质量和学习难度差异的问题,提出Uni-DPO统一框架,通过自适应重加权偏好对实现更有效的数据利用和更优性能。

Comments Accepted by ICLR 2026. Code & models: https://github.com/pspdada/Uni-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11767 2026-05-20 cs.AI cs.CL cs.LG 88%

TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

TSR:用于LLM代理多轮RL的轨迹搜索

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TSR,一种在训练时改进每轮轨迹生成的方法,通过轻量级树状搜索构造高质量轨迹,提升rollout质量和学习稳定性,适用于多轮RL任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06624 2026-04-30 cs.CL cs.AI cs.LG 88%

A Practice of Post-Training on Llama-3 70B with Optimal Selection of Additional Language Mixture Ratio

在Llama-3 70B上进行训练实践:最优额外语言混合比例的选择

Ningyuan Xi, Yetao Wu, Kun Fan, Teng Chen, Qingqing Gu, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室) Beihang University(北航)

专题命中 后训练与偏好优化 :post-training(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过在Llama-3 8B和70B上进行持续预训练,研究额外语言混合比例与学习率的最优相关性,提升中文能力及数学、编程等领域的表现,并在实际聊天系统中部署70B模型取得良好效果。

Comments 12 pages, 2 figures. PAKDD2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 88%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03098 2026-04-06 cs.LG cs.AI cs.CL 88%

Co-Evolution of Policy and Internal Reward for Language Agents

语言代理中策略与内部奖励的共演化

Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu Luo, Chenglin Wu, Bang Liu

机构 * McGill University(麦吉尔大学) McMaster University(麦克马斯特大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) DeepWisdom(深度智慧) Université de Montréal(蒙特利尔大学) Mila(米拉研究所)

专题命中 后训练与偏好优化 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Self-Guide方法,通过自动生成内部奖励实现推理和训练时的协同优化,提升语言代理性能。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 88%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15745 2025-12-25 cs.LG cs.AI cs.CL 88%

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13022 2025-12-01 cs.CL cs.AI cs.LG 88%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12211 2025-10-15 cs.IR 88%

Reinforced Preference Optimization for Recommendation

Junfei Tan, Yuxin Chen, An Zhang, Junguang Jiang, Bin Liu, Ziru Xu, Han Zhu, Jian Xu, Bo Zheng, Xiang Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10839 2025-08-15 cs.CL cs.AI cs.LG 88%

Reinforced Language Models for Sequential Decision Making

Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13417 2025-08-08 cs.CL cs.AI cs.LG 88%

RLTHF: Targeted Human Feedback for LLM Alignment

Yifei Xu, Tusher Chakraborty, Emre Kıcıman, Bibek Aryal, Eduardo Rodrigues, Srinagesh Sharma, Roberto Estevao, Maria Angels de Luis Balaguer, Jessica Wolk, Rafael Padilha, Leonardo Nunes, Shobana Balakrishnan, Songwu Lu, Ranveer Chandra

机构 * Microsoft(微软公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Presented at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01492 2025-07-03 cs.CV 88%

AVC-DPO: Aligned Video Captioning via Direct Preference Optimization

Jiyang Tang, Hengyi Li, Yifan Du, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) College of Artificial Intelligence, Nankai University(南开大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19964 2025-05-27 cs.LG cs.AI cs.CL cs.GT 88%

The Limits of Preference Data for Post-Training

Eric Zhao, Jessica Dai, Pranjal Awasthi

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18922 2025-05-22 cs.LG cs.AI cs.CL stat.ML 88%

DPO Meets PPO: Reinforced Token Optimization for RLHF

Han Zhong, Zikang Shan, Guhao Feng, Wei Xiong, Xinle Cheng, Li Zhao, Di He, Jiang Bian, Liwei Wang

机构 * Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16852 2025-02-25 cs.LG cs.AI cs.CL 88%

Improving LLM General Preference Alignment via Optimistic Online Mirror Descent

Yuheng Zhang, Dian Yu, Tao Ge, Linfeng Song, Zhichen Zeng, Haitao Mi, Nan Jiang, Dong Yu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16646 2025-02-11 cs.CL cs.AI cs.LG 88%

Self-Generated Critiques Boost Reward Modeling for Language Models

Yue Yu, Zhengxing Chen, Aston Zhang, Liang Tan, Chenguang Zhu, Richard Yuanzhe Pang, Yundi Qian, Xuewei Wang, Suchin Gururangan, Chao Zhang, Melanie Kambadur, Dhruv Mahajan, Rui Hou

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments Accepted to NAACL 2025 (Main Conference)

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07886 2025-01-15 cs.LG cs.AI cs.CL 88%

Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision

Yaowen Ye, Cassidy Laidlaw, Jacob Steinhardt

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);post-training(abstract);SFT(abstract)

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15244 2024-12-23 cs.CL cs.AI cs.LG 88%

MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples

Shuo Xie, Fangzhi Zhu, Jiahui Wang, Lulu Wen, Wei Dai, Xiaowei Chen, Junxiong Zhu, Kai Zhou, Bo Zheng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Accepted by COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01951 2024-12-05 cs.AI cs.CL cs.LG stat.ML 88%

Self-Improvement in Language Models: The Sharpening Mechanism

Audrey Huang, Adam Block, Dylan J. Foster, Dhruv Rohatgi, Cyril Zhang, Max Simchowitz, Jordan T. Ash, Akshay Krishnamurthy

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05981 2024-11-20 cs.LG cs.AI cs.CL 88%

ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization

Haoran You, Yipin Guo, Yichao Fu, Wei Zhou, Huihong Shi, Xiaofan Zhang, Souvik Kundu, Amir Yazdanbakhsh, Yingyan Celine Lin

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05875 2024-11-12 cs.LG cs.AI cs.CL 88%

Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization

Zhuotong Chen, Fang Liu, Jennifer Zhu, Wanyu Du, Yanjun Qi

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12168 2024-10-23 cs.LG cs.AI cs.CL 88%

BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment

Wenda Xu, Jiachen Li, William Yang Wang, Lei Li

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Wenda Xu and Jiachen Li contributed equally. Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15360 2024-10-17 cs.LG cs.AI cs.CL 88%

Reward-Robust RLHF in LLMs

Yuzi Yan, Xingzhou Lou, Jialian Li, Yiping Zhang, Jian Xie, Chao Yu, Yu Wang, Dong Yan, Yuan Shen

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11819 2024-10-15 cs.LG cs.AI cs.CL 88%

An Adaptive Placement and Parallelism Framework for Accelerating RLHF Training

Youshao Xiao, Zhenglei Zhou, Fagui Mao, Weichang Wu, Shangchun Zhao, Lin Ju, Lei Liang, Xiaolu Zhang, Jun Zhou

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05868 2024-10-14 cs.LG cs.AI cs.CL stat.ML 88%

Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning

Ruiqi Zhang, Licong Lin, Yu Bai, Song Mei

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10164 2024-09-17 cs.LG cs.AI cs.CL 88%

Quantile Regression for Distributional Reward Models in RLHF

Nicolai Dorka

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00267 2024-09-04 cs.CL cs.AI cs.LG 88%

RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Harrison Lee, Samrat Phatale, Hassan Mansoor, Thomas Mesnard, Johan Ferret, Kellie Lu, Colton Bishop, Ethan Hall, Victor Carbune, Abhinav Rastogi, Sushant Prakash

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Presented at ICML 2024

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:26874-26901, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏