arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2603.13506 2026-03-18 cs.CV 75%

LibraGen: Playing a Balance Game in Subject-Driven Video Generation

LibraGen:在以主题驱动的视频生成中进行平衡游戏

Jiahao Zhu, Shanshan Lao, Lijie Liu, Gen Li, Tianhao Qi, Wei Han, Bingchuan Li, Fangfang Liu, Zhuowei Chen, Tianxiang Ma, Qian HE, Yi Zhou, Xiaohua Xie

机构 * Pazhou Laboratory (Huangpu)(黄埔实验室( Pazhou))

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 LibraGen通过平衡视频生成基础模型的内在先验与主题到视频能力,提出了一种新的框架,采用质量优先策略和动态分类器自由引导方案,提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12050 2026-03-16 cs.CL cs.AI cs.LG 75%

AdaBoN: Adaptive Best-of-N Alignment

AdaBoN: 适应性最佳N对齐

Vinod Raman, Hilal Asi, Satyen Kale

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11595 2026-03-11 cs.LG cs.AI cs.CL 75%

Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO

逐步引导策略优化:在GRPO中着色你的错误推理

Peter Chen, Xiaopeng Li, Ziniu Li, Xi Chen, Tianyi Lin

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Department of Mathematics(数学系) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。

Comments Accepted by TMLR; 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL 75%

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15477 2026-03-02 cs.LG cs.AI cs.CL stat.ML 75%

What Makes a Reward Model a Good Teacher? An Optimization Perspective

什么使奖励模型成为好的老师?从优化角度出发

Noam Razin, Zixuan Wang, Hubert Strauss, Stanley Wei, Jason D. Lee, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 从优化角度研究奖励模型的有效性,发现奖励方差对优化效率至关重要,准确性不足以保证模型效果。

Comments Accepted to NeurIPS 2025; Code available at https://github.com/princeton-pli/what-makes-good-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05165 2026-02-24 cs.LG cs.AI cs.CL 75%

EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization

EBPO:经验贝叶斯收缩用于稳定群体相对策略优化

Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang

机构 * Meta AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EBPO通过经验贝叶斯收缩方法稳定群体相对策略优化,有效降低估计方差并提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10418 2026-02-12 cs.CR cs.SE 75%

SecCodePRM: A Process Reward Model for Code Security

SecCodePRM: 一种用于代码安全的过程奖励模型

Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SecCodePRM通过一种面向安全的过程奖励模型,提升代码安全性和检测效率,适用于完整代码漏洞检测、部分代码漏洞检测和安全代码生成。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10109 2026-02-11 cs.RO 75%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract)

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 75%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07326 2026-02-04 cs.CL cs.AI cs.CY cs.LG 75%

Reward Model Interpretability via Optimal and Pessimal Tokens

通过最优和最劣 tokens 实现奖励模型可解释性

Brian Christian, Hannah Rose Kirk, Jessica A. F. Thompson, Christopher Summerfield, Tsvetomira Dumbalska

机构 * University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析奖励模型对不同token的评分,揭示了模型间的异质性、评分不对称性及潜在偏见,挑战了奖励模型的可互换性及代理人类价值观的假设。

Comments Accepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16276 2026-01-26 cs.CL cs.AI cs.GT cs.LG cs.MA 75%

GameTalk: Training LLMs for Strategic Conversation

GameTalk: 训练 LLMs 进行战略性对话

Victor Conchello Vendrell, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GameTalk 通过多轮互动训练 LLMs 实现战略性决策,优于传统方法,尤其在奖励塑造下表现突出。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14525 2026-01-22 cs.CL cs.AI cs.LG 75%

Towards Execution-Grounded Automated AI Research

面向执行导向的自动化AI研究

Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12758 2026-01-21 cs.CL cs.AI cs.LG 75%

VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

VISPA:通过自动价值选择和激活实现多元对齐

Shenyan Zheng, Jiayou Zhong, Anudeex Shetty, Heng Ji, Preslav Nakov, Usman Naseem

机构 * University of Waterloo(滑铁卢大学) University of Melbourne(墨尔本大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MBZUAI(马克斯·普朗克智能系统研究所) Macquarie University(麦考瑞大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VISPA通过自动价值选择和激活实现多元对齐,适用于多种模型和场景,提供了一种可扩展的语言模型对齐方法。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06180 2026-01-13 cs.LG cs.AI cs.CL 75%

MixDPO: Modeling Preference Strength for Pluralistic Alignment

MixDPO:建模偏好强度以实现多元对齐

Saki Imai, Pedram Heydari, Anthony Sicilia, Asteria Kaeberlein, Katherine Atwell, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixDPO通过建模偏好强度差异,提升多样的偏好对齐性能,同时保持子群体偏好,适用于高异质性场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05002 2026-01-09 cs.LG cs.AI cs.CL 75%

On the Hidden Objective Biases of Group-based Reinforcement Learning

基于群体的强化学习中的隐藏目标偏差

Aleksandar Fontana, Marco Simoni, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna(机器人与人工智能卓越部门、TeCIP、圣安娜高等学院) Institute of Informatics and Telematics, National Research Council of Italy(信息与电信研究所、意大利国家研究委员会) National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士项目、萨皮恩扎罗马大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文分析了基于群体的强化学习方法中的隐藏目标偏差,揭示了非均匀群体加权、AdamW优化器影响及动量对策略更新的影响,为未来方法设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD 75%

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);preference optimization(abstract)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-01-08 cs.CV 75%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10365 2025-12-12 cs.LG cs.AI cs.CL 75%

GPG: Generalized Policy Gradient Theorem for Transformer-based Policies

基于Transformer策略的广义策略梯度定理

Hangyu Mao, Guangting Dong, Zhicheng Dou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于Transformer策略的广义策略梯度定理,揭示了标准策略梯度定理和GRPO的特殊案例,并探讨了其在训练大型语言模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03772 2025-12-12 cs.LG cs.AI cs.CL 75%

GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control

GTPO:通过梯度和熵控制稳定群体相对策略优化

Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士学院,罗马萨皮恩扎大学) Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna, Pisa(机器人与人工智能卓越部门,TeCIP,圣安娜高等学院,比萨) Institute of Informatics and Telematics, National Research Council of Italy, Pisa(信息与电信研究所,意大利国家研究理事会,比萨)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GTPO通过梯度和熵控制稳定群体相对策略优化,提升大语言模型对齐的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02882 2025-12-03 cs.LG cs.AI cs.CL 75%

OptPO: Optimal Rollout Allocation for Test-time Policy Optimization

OptPO:测试时间策略优化的最优回放分配

Youkang Wang, Jian Wang, Rubing Chen, Tianyi Zeng, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20347 2025-12-02 cs.LG cs.AI cs.CL 75%

Soft Adaptive Policy Optimization

软适应策略优化

Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, Junyang Lin

机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21270 2025-11-27 cs.SD cs.CV 75%

Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

多奖励GRPO用于大规模稳定且有声调的单代码本TTS LLMs

Yicheng Zhong, Peiji Yang, Zhisheng Wang

机构 * Tencent Technology Co.Ltd(腾讯科技有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多奖励GRPO框架,通过优化单代码本TTS LLMs的生成策略,提升语音的语调稳定性、说话者相似性和自然度。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03143 2025-11-06 cs.HC cs.AI cs.CL cs.CY cs.LG 75%

From Measurement to Expertise: Empathetic Expert Adapters for Context-Based Empathy in Conversational AI Agents

Erfan Shayegani, Jina Suh, Andy Wilson, Nagu Rangan, Javier Hernandez

机构 * Microsoft Research(微软研究院) University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05102 2025-11-03 cs.CL cs.AI cs.LG 75%

SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks

Fenia Christopoulou, Ronald Cardenas, Gerasimos Lampouras, Haitham Bou-Ammar, Jun Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 27 pages, 9 figures, 5 tables. Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25884 2025-10-31 cs.AI cs.CL cs.LG 75%

Approximating Human Preferences Using a Multi-Judge Learned System

Eitán Sprejer, Fernando Avalos, Augusto Bernardi, Jose Pedro Brito de Azevedo Faustino, Jacob Haimes, Narmeen Fatimah Oozeer

机构 * BAISH | UBA | Apart Research(BAISH | UBA | Apart研究) University of São Paulo(圣保罗大学) Apart Research(Apart研究) Dovetail Research | Apart Research(Dovetail研究 | Apart研究)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05465 2025-10-28 cs.CL cs.AI cs.LG 75%

ComPO: Preference Alignment via Comparison Oracles

Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) Stern School of Business(斯特恩商学院) New York University(纽约大学) DAMO Academy, Alibaba Group US(阿里云达摩院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11080 2025-10-27 cs.CL cs.AI cs.LG 75%

BLEUBERI: BLEU is a surprisingly effective reward for instruction following

Yapei Chang, Yekyung Kim, Michael Krumdick, Amir Zadeh, Chuan Li, Chris Tanner, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments neurips cam-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14374 2025-10-17 cs.CV 75%

Spatial Preference Rewarding for MLLMs Spatial Understanding

Han Qiu, Peng Gao, Lewei Lu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院) Zhejiang University of Technology(浙江工业大学) UCAS-Terminus AI Lab,University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13660 2025-10-17 cs.CV 75%

OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild

Hongyu Qu, Jianan Wei, Xiangbo Shu, Yazhou Yao, Wenguan Wang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Nanjing Forestry University(南京林业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to NeurIPS 2025; Project page: https://github.com/quhongyu/OmniGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10201 2025-10-14 cs.LG cs.AI cs.CL 75%

RLFR: Extending Reinforcement Learning for LLMs with Flow Environment

Jinghao Zhang, Naishan Zheng, Ruilin Li, Dongzhou Cheng, Zheming Liang, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动) Wuhan University(武汉大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Website: https://jinghaoleven.github.io/RLFR/

详情

展开后加载摘要…

URL PDF HTML 收藏