arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2602.01750 2026-02-03 cs.AI cs.LG 73%

Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking

对抗性奖励审计用于主动检测和缓解奖励黑客

Mohammad Beigi, Ming Jin, Junshan Zhang, Qifan Wang, Lifu Huang

机构 * Department of Computer Science, University of California, Davis, USA(加州大学戴维斯分校计算机科学系) Meta AI Research(Meta AI研究院)

专题命中 后训练与偏好优化 :SFT(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出对抗性奖励审计框架,通过动态竞争机制检测并缓解奖励黑客问题,实现最佳的对齐-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00677 2026-02-02 cs.LG cs.AI 73%

IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models

IRPM:基于组间相对偏好的点wise生成奖励模型

Haonan Song, Qingchen Xie, Huan Zhu, Feng Xiao, Luxi Xing, Liu Kang, Fuzhen Li, Zhiyong Zheng, Feng Jiang, Ziheng Li, Kun Yan, Qingyi Si, Yanghua Xiao, Hongcheng Guo, Fan Yang

机构 * HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China Department of Automation, Tsinghua University, Beijing, China Fudan University, Shanghai, China Beihang University, Beijing, China Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China

专题命中 后训练与偏好优化 :post-training(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IRPM通过组间比较扩展Bradley-Terry模型,从成对偏好数据中训练点wise GRMs,实现高效可扩展的奖励建模。

Comments Comments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14616 2026-01-29 cs.CL cs.AI 73%

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

超越正确性:跨文化的主观写作偏好评估

Shuangshuang Ying, Yunwen Li, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Xeron Du, Tianyu Zheng, Yichi Zhang, Letian Ni, Yuyang Cheng, Zhenzhu Yang, Qiguang Chen, Jingzhe Ding, Shengda Long, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Ge Zhang, Wenhao Huang, Wanxiang Che, Chenghua Lin

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18760 2026-01-27 cs.LG cs.CL 73%

Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values

超越偏好:基于人类理由和价值观的学习对齐原则

Henry Bell, Lara Neubauer da Costa Schertel, Bochu Ding, Brandon Fain

机构 * Duke University(杜克大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16944 2026-01-27 cs.LG cs.AI 73%

Pretrain Value, Not Reward: Decoupled Value Policy Optimization

预训练价值,而非奖励:解耦的价值策略优化

Chenghua Huang, Lu Wang, Fangkai Yang, Pu Zhao, Zhixu Li, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Microsoft(微软公司)

专题命中 后训练与偏好优化 :pretraining(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解耦的价值策略优化方法,通过预训练价值模型替代传统奖励模型,实现了更稳定高效的强化学习。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14175 2026-01-27 cs.CL cs.AI 73%

GRAM: A Generative Foundation Reward Model for Reward Generalization

GRAM:一种用于奖励泛化的大规模生成式奖励模型

Chenglong Wang, Yang Gan, Yifu Huo, Yongyu Mu, Qiaozhi He, Murun Yang, Bei Li, Tong Xiao, Chunliang Zhang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) NiuTrans Research, Shenyang, China(NiuTrans研究) CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS, Beijing, China(中国科学院行为科学重点实验室) Meituan Inc.(美团公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GRAM提出了一种生成式奖励模型,通过结合无监督和监督学习,提升奖励模型在多种任务上的泛化能力,有效改进了基线模型的性能。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16987 2026-01-27 cs.CL cs.AI 73%

Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions

通过成对最大分歧竞赛评估奖励模型泛化能力

Shunyang Luo, Peibei Cao, Zhihui Zhu, Kehua Feng, Zhihua Wang, Keyan Ding

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PMDC方法,通过动态选择高争议测试案例评估奖励模型的泛化能力,并揭示了现有模型的系统性泛化失败问题。

Comments 17 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 73%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26167 2026-01-14 cs.AI cs.CL 73%

ToolRM: Towards Agentic Tool-Use Reward Modeling

ToolRM: 向代理工具使用奖励建模迈进

Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang

机构 * University of Macau(澳门大学) Qwen Team, Alibaba Inc.(阿里云Qwen团队) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ToolRM通过构建高质量偏好数据集和基准,提升代理AI在工具调用任务中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 73%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 73%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL 73%

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 73%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07544 2025-12-09 cs.CL cs.AI 73%

MoCoRP: Modeling Consistent Relations between Persona and Response for Persona-based Dialogue

MoCoRP: 模型对话中人设与回应之间的一致性关系

Kyungro Lee, Dongha Choi, Hyunju Lee

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MoCoRP通过显式建模人设与回应之间的一致性关系,提升基于人设的对话生成质量与一致性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11227 2025-12-09 cs.AI cs.LG 73%

Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs

PRM是否必要?问题解决RL隐式地在LLMs中诱导PRM能力

Zhangying Feng, Qianglong Chen, Ning Lu, Yongqian Li, Siqi Cheng, Shuangmu Peng, Duyu Tang, Shengcai Liu, Zhirui Zhang

机构 * Huawei Technologies Ltd.(华为技术有限公司) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(广东省脑启发智能计算重点实验室、信息科学部、南方科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现纯RL训练可提升LLMs的推理能力并隐式诱导PRM能力,挑战了PRM的必要性。

Comments Accepted by NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06533 2025-12-09 cs.LG cs.AI 73%

Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning

超越标记级监督:通过强化学习解锁解码回归的潜力

Ming Chen, Sheng Tang, Rong-Xi Tan, Ziniu Li, Jiacheng Chen, Ke Xue, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过强化学习提升基于解码的回归性能,引入序列级信号以提高预测精度和采样效率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08364 2025-12-02 cs.CL cs.AI 73%

DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering

DPRM: 多跳问答任务中的双隐式过程奖励模型

Xinyi Wang, Yiping Song, Zhiliang Tian, Bo Liu, Tingjin Luo, Minlie Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DPRM通过双隐式过程奖励模型提升多跳问答任务的推理准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 73%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13787 2025-11-19 cs.LG cs.AI 73%

Preference Learning with Lie Detectors can Induce Honesty or Evasion

Chris Cundy, Adam Gleave

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15217 2025-11-18 cs.SD cs.AI cs.LG cs.MM 73%

DRAGON: Distributional Rewards Optimize Diffusion Generative Models

Yatong Bai, Jonah Casebeer, Somayeh Sojoudi, Nicholas J. Bryan

机构 * University of California, Berkeley(加州大学伯克利分校) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09338 2025-11-10 stat.ML cs.AI cs.LG 73%

Know What You Don't Know: Uncertainty Calibration of Process Reward Models

Young-Jin Park, Kristjan Greenewald, Kaveh Alim, Hao Wang, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20241 2025-11-05 cs.LG cs.AI 73%

DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning

Qi Cao, Ruiyi Wang, Ruiyi Zhang, Sai Ashish Somayajula, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 10 figures, to appear in NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23751 2025-10-29 cs.LG cs.AI stat.ML 73%

Debiasing Reward Models by Representation Learning with Guarantees

Ignavier Ng, Patrick Blöbaum, Siddharth Bhandari, Kun Zhang, Shiva Kasiviswanathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德智能大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13934 2025-10-28 cs.LG cs.AI 73%

RLVR-World: Training World Models with Reinforcement Learning

Jialong Wu, Shaofeng Yin, Ningya Feng, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,北研所,清华大学) Zhili College, Tsinghua University(知礼学院,清华大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. Code is available at project website: https://thuml.github.io/RLVR-World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17859 2025-10-27 cs.LG cs.AI stat.ML 73%

Scalable Valuation of Human Feedback through Provably Robust Model Alignment

Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne

机构 * The University of Osaka(大阪大学) Lattice Lab, Toyota Motor Corporation(丰田公司Lattice实验室) Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组) RIKEN AIP(理化学研究所AIP)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS2025), 49 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19173 2025-10-23 q-fin.CP cs.AI cs.LG 73%

News-Aware Direct Reinforcement Trading for Financial Markets

Qing-Yu Lan, Zhan-He Wang, Jun-Qian Jiang, Yu-Tong Wang, Yun-Song Piao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19050 2025-10-23 cs.AI cs.LG 73%

Rectifying Shortcut Behaviors in Preference-based Reward Learning

Wenqian Ye, Guangtao Zheng, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07558 2025-10-14 cs.LG cs.AI 73%

VL Norm: Rethink Loss Aggregation in RLVR

Zhiyuan He, Xufang Luo, Yike Zhang, Yuqing Yang, Lili Qiu

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07737 2025-10-10 cs.CL cs.LG 73%

ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs

Fu Chen, Peng Wang, Xiyin Li, Wen Li, Shichi Lei, Dongdong Xiang

机构 * OPPO East China Normal University(东华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06391 2025-10-09 cs.CL cs.AI 73%

Reward Model Perspectives: Whose Opinions Do Reward Models Reward?

Elle

机构 * Elle University of Oxford(埃勒 奥克舍大学)

专题命中 后训练与偏好优化 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Published at EMNLP 2025 under the full author name "Elle"

详情

展开后加载摘要…

URL PDF HTML 收藏