arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4507 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4507 篇

2605.00224 2026-05-04 cs.AI 89%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20685 2026-04-23 cs.LG 89%

MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment

MGDA-Decoupled:基于几何的多目标优化用于基于DPO的LLM对齐

Andor Vári-Kakas, Ji Won Park, Natasa Tagasovska

机构 * Prescient Design, CS CoE, Genentech | Roche(预见设计,计算机科学学院,基因泰克 | 罗氏)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MGDA-Decoupled算法,通过几何方法在DPO框架内实现更公平的多目标优化,实验显示其在UltraFeedback数据集上表现最优。

Comments Accepted to the Algorithmic Fairness Across Alignment Procedures and Agentic Systems Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI 89%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07449 2026-04-17 cs.IR cs.AI 89%

RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking

RLPO:长上下文评论排序的残差列表偏好优化

Hao Jiang, Zhi Yang, Annan Wang, Yichi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLPO,通过残差列表级优化提升长上下文评论排序,解决传统方法在长上下文下的效率与准确性矛盾,实验显示其在NDCG@k上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 89%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-02-10 cs.CV cs.AI 89%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);RLHF(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06453 2026-02-09 cs.LG 89%

On the Plasticity and Stability for Post-Training Large Language Models

关于后训练大语言模型的可塑性与稳定性

Wenwen Qiang, Ziyin Gu, Jiahuan Zhou, Jie Hu, Jingyao Wang, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科技大学(香港特别行政区)计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(title);分类 cs.LG

AI总结 本文提出PCR框架,通过概率方法解决GRPO中可塑性与稳定性之间的几何冲突,提升训练稳定性与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00709 2025-12-02 cs.AI 89%

When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF

当人类偏好翻转时:面向RLHF的实例依赖性鲁棒损失

Yifan Xu, Xichen Ye, Yifan Chen, Qiaosheng Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种面向RLHF的实例依赖性鲁棒损失算法,通过建模偏好翻转机制和引入实例依赖的翻转概率,提升对齐算法的鲁棒性。

Comments Accepted by AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09389 2025-10-08 cs.CL 89%

Measuring LLM Novelty As The Frontier Of Original And High-Quality Output

Vishakh Padmakumar, Chen Yueh-Han, Jane Pan, Valerie Chen, He He

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Updated results with higher coverage of open-data models and better quality judgments

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06424 2025-07-30 cs.CL cs.CY 89%

Training LLM-based Tutors to Improve Student Learning Outcomes in Dialogues

Alexander Scarlatos, Naiming Liu, Jaewook Lee, Richard Baraniuk, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Rice University(Rice大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Published in AIED 2025: The 26th International Conference on Artificial Intelligence in Education

Journal ref In Artificial Intelligence in Education. AIED 2025. Lecture Notes in Computer Science(), vol 15877. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12854 2025-07-29 cs.CL 89%

Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation

Songjun Tu, Jiahao Lin, Xiangyu Tian, Qichao Zhang, Linjing Li, Yuqian Fu, Nan Xu, Wei He, Xiangyuan Lan, Dongmei Jiang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wenge Technology(文生科技) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 23pages

Journal ref COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04427 2025-07-09 cs.CL 89%

One fish, two fish, but not the whole sea: Alignment reduces language models' conceptual diversity

Sonia K. Murthy, Tomer Ullman, Jennifer Hu

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)

Comments 17 pages, 10 figures; updated with publishing information

Journal ref Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04686 2025-06-19 cs.AI 89%

Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization

Zelai Xu, Wanjun Gu, Chao Yu, Yi Wu, Yu Wang

机构 * Tsinghua University, Beijing, China(清华大学) Beijing Zhongguancun Academy, Beijing, China(北京中关村学院) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究所)

专题命中 后训练与偏好优化 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Published in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07492 2025-06-10 cs.LG stat.ML 89%

Explicit Preference Optimization: No Need for an Implicit Reward Model

Xiangkun Hu, Lemin Kong, Tong He, David Wipf

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2407.09072

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07035 2025-06-10 q-bio.BM cs.AI 89%

AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization

Zixuan Jiang, Renjing Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00888 2025-04-22 cs.CL cs.HC 89%

Aligning Language Models with Demonstrated Feedback

Omar Shaikh, Michelle S. Lam, Joey Hejna, Yijia Shao, Hyundong Cho, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) USC(美国南加州大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);RLHF(abstract);preference optimization(abstract)

Comments ICLR 2025; 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04950 2025-04-08 cs.LG 89%

A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization

Wenyuan Xu, Xiaochen Zuo, Chao Xin, Yu Yue, Lin Yan, Yonghui Wu

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 11oages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01233 2025-03-04 cs.CL 89%

PEO: Improving Bi-Factorial Preference Alignment with Post-Training Policy Extrapolation

Yuxuan Liu

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10914 2025-02-21 cs.CL 89%

BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment

Sizhe Wang, Yongqi Tong, Hengyuan Zhang, Dawei Li, Xin Zhang, Tianlong Chen

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments The 2025 Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL 2025)- Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12735 2025-02-10 cs.LG 89%

Online Preference Alignment for Language Models via Count-based Exploration

Chenjia Bai, Yang Zhang, Shuang Qiu, Qiaosheng Zhang, Kang Xu, Xuelong Li

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12895 2025-01-23 cs.CL 89%

Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback

Yafu Li, Xuyang Hu, Xiaoye Qu, Linjie Li, Yu Cheng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 43 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19443 2025-01-23 cs.CL 89%

Mixed Preference Optimization: Reinforcement Learning with Data Selection and Better Reference Model

Qi Gou, Cam-Tu Nguyen

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01798 2024-11-05 cs.LG 89%

SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF

Atoosa Chegini, Hamid Kazemi, Iman Mirzadeh, Dong Yin, Maxwell Horton, Moin Nabi, Mehrdad Farajtabar, Keivan Alizadeh

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08010 2026-08-11 cs.LG cs.AI 新提交 88%

Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models

面向时间序列基础模型强化学习后训练的真实值邻域正则化方法

Jianqi Zhang, Xingyu Zhang, Zeen Song, Changwen Zheng, Fanjiang Xu, Wenwen Qiang

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列基础模型强化学习后训练的次优崩溃问题,提出真实值邻域正则化方法,可缓解该问题并提升模型性能,且能灵活集成到各类强化学习方法中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16242 2026-07-21 cs.LG cs.AI cs.CR 新提交 88%

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整

Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

机构 * LERo

专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)

AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11686 2026-07-16 cs.LG cs.AI 版本更新 88%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 88%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24004 2026-06-24 cs.CL cs.AI 新提交 88%

Towards Spec Learning: Inference-Time Alignment from Preference Pairs

面向规范学习:从偏好对进行推理时对齐

Dhriti Krishnan, Tejas Goyal, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21943 2026-06-23 cs.LG cs.AI 新提交 88%

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

LLM上的模块化强化学习:从MDP创建到探索与学习

Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

机构 * VU Amsterdam(阿姆斯特丹自由大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Leiden University(莱顿大学) University of Warsaw(华沙大学) Simon Fraser University(西蒙菲莎大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文系统梳理LLM后训练中的强化学习方法,从MDP构建、探索策略到学习范式,揭示当前方法分布不均,指出价值函数、离策略AC及自举法等领域存在研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17226 2026-06-18 cs.CL cs.AI 版本更新 88%

Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed Story Retelling

复述、奖励、重复:面向叙事理论启发的故事复述的强化学习

David Y. Liu, Xanthe Muston, Dipankar Srirag, Aditya Joshi, Sebastian Sequoiah-Grayson

机构 * University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出RRR强化学习框架,结合结构主义叙事学与标量叙事性,通过d-RLAIF从文本特征中获取训练信号,无需参考输出,提升LLM故事复述的逻辑性、合理性和完整性。

Comments 8 Pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏