arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4526 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4526 篇

2502.12272 2026-05-01 cs.LG cs.AI cs.CL 83%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10009 2026-03-12 cs.LG cs.AI cs.CL 83%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24040 2026-03-02 cs.LG cs.AI cs.CL 83%

RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models

RewardUQ:一种用于不确定性感知奖励模型的统一框架

Daniel Yang, Samuel Stante, Florian Redhardt, Lena Libon, Parnian Kassraie, Ido Hakimi, Barna Pásztor, Andreas Krause

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 RewardUQ提出了一种统一框架,用于系统评估奖励模型的不确定性量化,通过比较常用方法和提出新排序策略,揭示模型大小和初始化对性能的影响,并开源框架促进新方法的发展和应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 83%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21506 2025-12-29 cs.LG cs.AI cs.CL cs.HC 83%

MotionTeller: Multi-modal Integration of Wearable Time-Series with LLMs for Health and Behavioral Understanding

MotionTeller: 多模态整合可穿戴时间序列与大语言模型用于健康和行为理解

Aiwei Zhang, Arvind Pillai, Andrew Campbell, Nicholas C. Jacobson

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MotionTeller通过整合可穿戴时间序列与大语言模型,实现高精度的自然语言行为摘要生成,提升健康和行为理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18127 2025-12-17 cs.IR cs.AI cs.CL cs.LG 83%

Holistic Utility Preference Learning for Listwise Alignment

整体效用偏好学习用于列表对齐

Jiacong Zhou, Xianyun Wang, Min Zhang, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01758 2025-11-04 cs.LG cs.AI cs.CL 83%

RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks

Mian Wu, Gavin Zhang, Sewon Min, Sergey Levine, Aviral Kumar

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Project page: https://mianwu01.github.io/RLAC_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03742 2025-09-03 cs.CL cs.AI cs.LG 83%

Beyond Scalar Reward Model: Learning Generative Judge from Preference Data

Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Baichuan AI(拜智科技) University of Copenhagen(哥本哈根大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Journal ref The Thirteenth International Conference on Learning Representations 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15717 2025-06-23 cs.LG cs.AI cs.CL 83%

daDPO: Distribution-Aware DPO for Distilling Conversational Abilities

Zhengze Zhang, Shiqi Wang, Yiqun Shen, Simin Guo, Dahua Lin, Xiaoliang Wang, Nguyen Cam-Tu, Fei Tan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) University of Chicago(芝加哥大学) The Chinese University of Hong Kong(香港中文大学) East China Normal University(华东师范大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17017 2025-06-11 cs.CV cs.AI cs.CL cs.LG 83%

Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO

Chengzhuo Tong, Ziyu Guo, Renrui Zhang, Wenyu Shan, Xinyu Wei, Zhenghao Xing, Hongsheng Li, Pheng-Ann Heng

机构 * CUHK(香港中文大学) MiuLar Lab(MiuLar 实验室) MMLab Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Code is released at https://github.com/ZiyuGuo99/Image-Generation-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01725 2025-06-03 cs.CV 83%

VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking

Desen Meng, Rui Huang, Zhilin Dai, Xinhao Li, Yifan Xu, Jun Zhang, Zhenpeng Huang, Meng Zhang, Lingshu Zhang, Yi Liu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Honor Device Co., Ltd(荣誉设备有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16792 2025-06-02 cs.LG cs.AI cs.CL 83%

Model Extrapolation Expedites Alignment

Chujie Zheng, Ziqi Wang, Heng Ji, Minlie Huang, Nanyun Peng

机构 * The CoAI Group, DCST, BNRist, Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12678 2025-05-27 cs.LG cs.AI cs.CL 83%

Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees

Yongtao Wu, Luca Viano, Yihang Chen, Zhenyu Zhu, Kimon Antonakopoulos, Quanquan Gu, Volkan Cevher

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00617 2025-03-04 cs.LG cs.AI cs.CL cs.GT 83%

Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning

Yuheng Zhang, Dian Yu, Baolin Peng, Linfeng Song, Ye Tian, Mingyue Huo, Nan Jiang, Haitao Mi, Dong Yu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00581 2025-02-25 cs.CL cs.AI cs.LG 83%

Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective

Yipeng Kang, Junqi Wang, Yexin Li, Mengmeng Wang, Wenming Tu, Quansen Wang, Hengli Li, Tingjun Wu, Xue Feng, Fangwei Zhong, Zilong Zheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07327 2025-02-10 cs.AI cs.CL cs.LG 83%

3D-Properties: Identifying Challenges in DPO and Charting a Path Forward

Yuzi Yan, Yibo Miao, Jialian Li, Yipin Zhang, Jian Xie, Zhijie Deng, Dong Yan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18417 2024-12-13 cs.LG cs.AI cs.CL cs.GT econ.GN q-fin.EC 83%

VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback

Guoxi Zhang, Jiuding Duan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01481 2024-09-04 cs.CL cs.AI cs.LG 83%

NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment

Gerald Shen, Zhilin Wang, Olivier Delalleau, Jiaqi Zeng, Yi Dong, Daniel Egert, Shengyang Sun, Jimmy Zhang, Sahil Jain, Ali Taghibakhshi, Markel Sanz Ausin, Ashwath Aithal, Oleksii Kuchaiev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 16 pages, 4 figures, Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02119 2024-07-10 cs.LG cs.AI cs.CL 83%

Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning

Yifang Chen, Shuohang Wang, Ziyi Yang, Hiteshi Sharma, Nikos Karampatziakis, Donghan Yu, Kevin Jamieson, Simon Shaolei Du, Yelong Shen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05910 2024-04-11 cs.CL cs.AI cs.LG 83%

SALMON: Self-Alignment with Instructable Reward Models

Zhiqing Sun, Yikang Shen, Hongxin Zhang, Qinhong Zhou, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments Previous Title: SALMON: Self-Alignment with Principle-Following Reward Models. Accepted to ICLR 2024. Project page: https://github.com/IBM/SALMON

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04769 2024-03-12 cs.CR cs.AI cs.CL cs.LG 83%

Using Hallucinations to Bypass GPT4's Filter

Benjamin Lemkin

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12187 2024-01-23 cs.LG cs.AI cs.CL 83%

WARM: On the Benefits of Weight Averaged Reward Models

Alexandre Ramé, Nino Vieillard, Léonard Hussenot, Robert Dadashi, Geoffrey Cideron, Olivier Bachem, Johan Ferret

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08678 2023-07-18 cs.CL cs.AI cs.LG 83%

Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations

Yanda Chen, Ruiqi Zhong, Narutatsu Ri, Chen Zhao, He He, Jacob Steinhardt, Zhou Yu, Kathleen McKeown

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05790 2025-09-03 cs.AI cs.HC cs.LG 83%

Understanding Impact of Human Feedback via Influence Functions

Taywon Min, Haeone Lee, Yongchan Kwon, Kimin Lee

机构 * KAIST(韩国科学技术院) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :RLHF(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at ACL 2025, Source code: https://github.com/mintaywon/IF_RLHF

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 63 (2025) 27471-27500

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10669 2025-05-20 cs.CL cs.AI 83%

UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality

Zelei Cheng, Xin-Qiang Cai, Yuting Tang, Pushi Zhang, Boming Yang, Masashi Sugiyama, Xinyu Xing

机构 * Northwestern University(西北大学) RIKEN-AIP(日本理化学研究所-AIP) The University of Tokyo(东京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :language model(abstract,comments);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments Language Modeling, Machine Learning for NLP, Distributional Pareto-Optimal

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12845 2024-06-19 cs.LG cs.CL 83%

Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts

Haoxiang Wang, Wei Xiong, Tengyang Xie, Han Zhao, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)

Comments Technical report v1. Code and model are released at https://github.com/RLHFlow/RLHF-Reward-Modeling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 83%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06179 2026-08-07 cs.LG 新提交 83%

SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐

Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

机构 * Linköping University(林雪平大学) University of Iceland(冰岛大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05341 2026-08-07 cs.CV cs.LG 新提交 83%

Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

面向胸部X射线报告生成的正例-无标签偏好优化

Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry, Vincent Jeanselme, Judy Wawira Gichoya, Sanmi Koyejo, Kathleen Capaccione, Shalmali Joshi

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02181 2026-08-04 cs.LG 新提交 83%

Start Classifying: Categorical Critics for LLM Reinforcement Learning

开始分类:用于大语言模型强化学习的分类式评判器

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent YoutuLab(腾讯优图实验室) Griffith University(格里菲斯大学) Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。

Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo

详情

展开后加载摘要…

URL PDF HTML 收藏