arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2606.09138 2026-06-09 cs.LG cs.CL 新提交 79%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08346 2026-06-09 cs.CL cs.LG 新提交 79%

CATPO: Critique-Augmented Tree Policy Optimization

CATPO: 批评增强的树策略优化

Ayush Singh, Umang Goyal, Ankur Dahiya

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Vision and Language Group(视觉与语言组)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CATPO方法,通过树信息性评分和批评引导修复,解决树结构强化学习中低效树浪费计算的问题,在数学推理任务上提升准确率。

Comments 14 pages, 1 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05734 2026-06-05 cs.AI cs.CL 79%

When AI Says It Feels

当AI说它感觉

Shin-nosuke Ishikawa, Seiya Ikeda, Hirotsugu Ohba

机构 * Graduate School of Artificial Intelligence and Science, Rikkyo University(立命馆大学人工智能与科学研究生院) AI Technical Sector, Mamezo Co., Ltd.(Mamezo公司人工智能技术部门) AI Consulting Division, Mamezo Co., Ltd.(Mamezo公司人工智能咨询部门)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过自奖励强化学习(GRPO)鼓励大语言模型表达情感、意图和自我意识,并评估其对多种任务性能的影响。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04560 2026-06-05 cs.LG cs.AI 79%

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

基于轨迹级别优势优先经验回放的GRPO

Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学人工智能研究所、人工智能研究机构、智能网络与计算中心及人工智能科学研究中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO样本效率低的问题,提出轨迹级经验回放缓冲器,通过年龄驱逐限制陈旧性、新鲜锚定组合保持在线策略、按优势幅度优先采样,在多个数学基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-06-02 cs.LG cs.AI 79%

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30323 2026-05-29 cs.LG cs.AI 79%

In-Context Reward Adaptation for Robust Preference Modeling

上下文奖励自适应用于鲁棒偏好建模

Zhenyu Sun, Zheng Xu, Ermin Wei

机构 * Northwestern University(西北大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 提出基于Transformer的上下文奖励自适应框架,通过少量偏好示例和人类反应时间辅助信号,在线建模多样且未见的人类偏好,实现鲁棒的偏好建模和分布偏移适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29582 2026-05-29 cs.LG cs.CL 79%

PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning

PEARL: 使用教学对齐强化学习训练苏格拉底式导师

Qikai Chang, Zhenrong Zhang, Linbo Chen, Pengfei Hu, Jianshu Zhang, Youhui Guo, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PEARL框架,通过可控学生模拟器、生成式奖励模型和稳定多目标强化学习,训练苏格拉底式教学代理,在多个基准上达到开源模型最佳性能并与专有模型竞争。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28561 2026-05-28 cs.CL cs.LG 79%

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

Soft-SVeRL: 基于软奖励的自验证强化学习

Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis

机构 * Cohere Labs(Cohere实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对部分可验证任务,提出基于检查表分解的软奖励框架Soft-RLVR及其自验证变体Soft-SVeRL,通过密集部分信用信号提升强化学习训练效果,并解决自验证中的奖励膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23061 2026-05-28 cs.LG cs.AI 79%

C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs

C-MORAL: 基于强化对齐的可控多目标分子优化用于大语言模型

Rui Gao, Youngseung Jeon, Swastik Roy, Morteza Ziyadi, Xiang 'Anthony' Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出C-MORAL框架,通过强化学习后训练结合分组相对优化、属性分数对齐和瓶颈敏感非线性奖励聚合,实现可控多目标分子优化,在C-MuMOInstruct和S$^2$-Bench MolOpt基准上取得最优性能。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17036 2026-05-27 cs.AI cs.LG cs.MA cs.SY eess.SY 79%

Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

自主AI代理在供应链管理中的可靠性与有效性

Carol Xuan Long, David Simchi-Levi, Feng Zhu, Huangyuan Su, Andre P. Calmon, Flavio P. Calmon

机构 * Harvard University(哈佛大学) MIT/Purdue(麻省理工学院/普渡大学) MIT(麻省理工学院) Harvard University/Kempner Institute(哈佛大学/凯普勒研究所) Georgia Tech(佐治亚理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过MIT啤酒游戏研究多级供应链中的自主生成式AI代理,发现模型能力是性能主导因素,但平均性能掩盖可靠性风险,并引入代理牛鞭效应,提出基于GRPO的后训练框架以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13775 2026-05-27 cs.LG cs.AI 79%

Beyond Semantics: The Unreasonable Effectiveness of Reasonless Intermediate Tokens

超越语义:无理由中间标记的不合理有效性

Karthik Valmeekam, Vardhan Palod, Kaya Stechly, Atharva Gundawar, Subbarao Kambhampati

机构 * School of Computing and AI(计算与人工智能学院) Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊人工通用智能) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过从零训练Transformer模型于形式可验证推理轨迹,发现模型在正确与损坏轨迹上表现相似,且损坏轨迹在分布外任务上泛化更好,挑战了中间标记反映或诱导可预测推理行为的假设。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11027 2026-05-26 cs.LG cs.AI cs.PL 79%

From Reasoning to Code: GRPO Optimization for Underrepresented Languages

从推理到代码:针对代表性不足语言的GRPO优化

Federico Pennino, Bianca Raimondi, Massimo Rondelli, Andrea Gurioli, Maurizio Gabbrielli

机构 * Qwen2.5-Coder

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合Qwen2.5-Coder小模型与GRPO的强化学习方法,利用执行反馈和奖励机制提升Prolog、Lisp等低资源语言的代码生成准确性与推理质量。

Comments Accepted ICLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18444 2026-05-26 cs.LG cs.AI 79%

Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards

折扣Beta-Bernoulli奖励估计用于基于可验证奖励的样本高效强化学习

Haechan Kim, Soohyun Ryu, Gyouk Chu, Doohyuk Jang, Eunho Yang

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对基于可验证奖励的强化学习样本效率低的问题,提出折扣Beta-Bernoulli奖励估计方法,利用历史奖励统计量降低估计方差并避免方差崩溃,在多个推理基准上显著提升性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20246 2026-05-22 cs.LG cs.AI 79%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20506 2026-05-21 cs.LG cs.CL 79%

Reinforcing Human Behavior Simulation via Verbal Feedback

通过言语反馈强化人类行为模拟

Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12667 2026-05-18 cs.LG cs.AI 79%

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

ODRPO:离散奖励的序分解以实现鲁棒策略优化

Nirmal Patel, Fei Wang, Inderjit S. Dhillon

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODRPO框架,通过将离散奖励分解为序二进制指标,减少噪声影响,提升策略优化鲁棒性,实验表明在Qwen2.5-7B和Qwen3-4B模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI 79%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08539 2026-05-08 cs.LG cs.AI cs.IT math.IT math.OC stat.ML 79%

On the optimization dynamics of RLVR: Gradient gap and step size thresholds

关于RLVR优化动态:梯度间隙和步长阈值

Joe Suk, Yaqi Duan

机构 * New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析RLVR训练过程,提出梯度间隙概念,揭示收敛依赖于更新方向与梯度间隙的对齐,并推导出步长阈值,解释了实践中长度归一化提升稳定性及固定学习率下成功率无法达到100%的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25872 2026-04-29 cs.LG cs.AI stat.ML 79%

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

当错误可能有益:对策略梯度中不完美奖励的分类

Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在策略梯度方法中,不完美奖励的错误并非全然有害,通过理论分析分类了不同类型的奖励误差对真实奖励增加的影响,提出了改进人类反馈强化学习和可验证奖励设计的实用方法。

Comments Code available at https://github.com/princeton-pli/imperfect-rewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05591 2026-04-24 cs.LG cs.CL 79%

Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning

熵比裁剪作为稳定强化学习的软全局约束

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Tiehua Mei, Zijia Lin, Yuntao Li, Wenping Hu, Ruiming Tang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) Independent(独立)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出熵比裁剪机制,通过量化策略探索的相对变化,缓解强化学习中的分布偏移问题,提升训练稳定性。

Comments This paper has been accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13175 2026-04-17 cs.LG cs.AI q-bio.BM q-bio.QM 79%

Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization

通过平滑切比雪夫标量化实现帕累托最优的离线强化学习

Aadyot Bhatnagar, Peter Mørch Groth, Ali Madani

机构 * Profluent Bio, Inc.(Profluent生物公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STOMP算法,通过平滑切比雪夫标量化方法解决多目标强化学习中的非凸帕累托前沿问题,验证了其在蛋白质工程任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09855 2026-04-14 cs.AI cs.CL cs.GT econ.GN q-fin.EC 79%

Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards

通过可验证奖励的强化学习指导大语言模型进行谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Lei Lei, Yuheng Zhang, Yisong Yue, David Simchi-Levi

机构 * Purdue University(普渡大学) California Institute of Technology(加州理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过可验证奖励的强化学习训练大语言模型进行谈判的有效性,揭示了四阶段战略演化,展示了训练后的模型在谈判中提取剩余价值的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08723 2026-04-13 cs.CL cs.AI 79%

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

分解Delta:模型实际上从偏好对中学习了什么?

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02652 2026-04-06 cs.LG cs.AI 79%

Generalization Limits of Reinforcement Learning Alignment

强化学习对齐的泛化极限

Haruhi Shida, Koo Imai, Keigo Kansa

机构 * Aladdin Security Inc(阿拉丁安全公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习对齐技术的泛化能力限制,提出复合越狱方法,通过结合多种攻击技术提高攻击成功率,验证了安全训练无法广泛泛化 hypothesis。

Comments 7 pages, 2 figures, 2 tables, accepted at JSAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 79%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 79%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 后训练与偏好优化 :foundation model(abstract);pretraining(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21175 2026-03-24 cs.LG cs.AI 79%

Reward Sharpness-Aware Fine-Tuning for Diffusion Models

奖励敏锐度感知的扩散模型微调

Kwanyoung Kim, Byeongsu Sim

机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) Samsung Research(三星研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。

Comments Cam ready version of CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20212 2026-03-24 cs.CL cs.LG 79%

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

快速-缓慢思考RM:标量与生成奖励模型的有效整合

Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10045 2026-03-18 cs.AI cs.LG 79%

CHARM: Calibrating Reward Models With Chatbot Arena Scores

CHARM:通过聊天机器人竞技场分数校准奖励模型

Xiao Zhu, Chenmien Tan, Pinzhen Chen, Rico Sennrich, Huiming Wang, Yanlin Zhang, Hanxu Hu

机构 * Alibaba Group(阿里巴巴集团) Queen’s University Belfast(贝尔法斯特女王大学) University of Zurich(苏黎世大学) Singapore University of Technology(新加坡科技设计大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CHARM方法,通过利用Chatbot Arena的Elo分数校准奖励模型,减少模型偏好偏差,提升奖励模型的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08035 2026-03-10 cs.AI cs.LG 79%

CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling

CDRRM:基于对比的评分标准生成用于可靠和可解释的奖励建模

Dengcan Liu, Fengkai Yang, Xiaohan Wang, Shurui Yan, Jiajun Chai, Jiahao Li, Yikun Ban, Zhendong Mao, Wei Lin, Guojun Yin

机构 * University of Science and Technology of China(科学技术大学) Peking University(北京大学) BeiHang University(北航大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CDRRM通过对比驱动的评分标准生成方法,实现可靠且可解释的奖励建模,有效缓解评估偏见并提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏