Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
可验证奖励下的强化学习中不对称提示加权
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.LG
AI总结 本文提出不对称提示加权方法,用于提升可验证奖励强化学习中低成功率提示的训练效率,尤其在从头开始的强化学习中表现更佳。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
可验证奖励下的强化学习中不对称提示加权
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.LG
AI总结 本文提出不对称提示加权方法,用于提升可验证奖励强化学习中低成功率提示的训练效率,尤其在从头开始的强化学习中表现更佳。
R-Align: 通过以推理为中心的元判断增强生成奖励模型
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。
Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align
SeeUPO:具有收敛保证的序列级代理强化学习
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SeeUPO通过逆向归纳实现多轮交互的单调改进和收敛,显著提升训练稳定性与性能
通过可验证的多选改写扩展RLVR以应对开放性任务
机构 * Baidu Ernie Team(百度文心团队)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。
Comments 8 pages
DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Korea University(韩国大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。
Comments NeurIPS 2025
SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考
机构 * National University of Singapore(新加坡国立大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。
通过强化学习逆向工程人类偏好
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过强化学习逆向工程人类偏好,利用LLM作为评判者框架提升评估效果,方法隐蔽且具有跨模型泛化能力。
Comments NeurIPS 2025 (Spotlight)
再思两次:分支与再思考推理奖励模型
机构 * NVIDIA(NVIDIA公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。
Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM
DBellQuant: 通过双铃变换打破贝尔限制以实现LLMs预训练后二值化
机构 * University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 DBellQuant通过双铃变换实现LLMs预训练后量化,显著提升压缩性能与模型效果。
Comments 19 pages; Appendix added
PEARL:多跳工具使用中的计划探索与自适应强化学习
机构 * Institute of Information Engineering, China(信息工程研究所,中国) ; School of Cyber Security, University of Chinese Academy of Sciences, China(中国科学院大学网络安全学院,中国)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 PEARL通过两阶段方法提升LLM在多跳工具使用中的规划与执行能力,实现ToolHop 56.5%的成功率。
Comments Accepted to PRICAI25
Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互
机构 * Yunnan University(云南大学) ; Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Southeast University(东南大学) ; Chongqing University(重庆大学) ; Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。
推动专家专业化以提升MoE
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 本文提出正交性损失和方差损失,提升MoE模型专家专业化,显著提高性能并保持负载平衡。
Comments 33pages, 6figures(Accepted by Neurips 2025 Oral)
你的组相对优势存在偏差
机构 * Beihang University(北航大学) ; University of California, Berkeley(加州大学伯克利分校) ; Peking University(北京大学) ; Meituan(美团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出HA-DW方法,通过修正组相对优势估计的偏差,提升基于组的强化学习在数学推理任务中的性能。
通过噪声感知学习实现鲁棒的过程奖励建模
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。
多模态奖励基准2:评估多模态奖励模型用于交错文本和图像
机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。
Comments Code and data available at https://github.com/facebookresearch/MMRB2
ToolPRMBench: 评估和推进用于工具使用智能体的过程奖励模型
机构 * Arizona State University(亚利桑那州立大学) ; Intuit AI Research(Intuit人工智能研究)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ToolPRMBench通过构建大规模基准评估工具使用智能体的过程奖励模型,揭示PRM有效性差异并展示专用PRMs的潜力。
Comments under review
通过交互蒸馏缓解判别奖励建模中的注意力黑客问题
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
AI总结 本文提出交互蒸馏方法,通过优化注意力机制提升判别奖励建模的稳定性与通用性,缓解注意力黑客问题。
超越助手的引导模型:通过对比解码控制系统提示强度
机构 * University of Cambridge(剑桥大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。
RIPRAG:通过强化学习攻击基于检索增强生成的黑盒问答系统
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 RIPRAG通过强化学习攻击黑盒RAG系统,提升污染攻击成功率0.72,揭示LLM安全防御的不足。
AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) ; University of Edinburgh(爱丁堡大学) ; University of Washington(华盛顿大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。
解封预训练模型作为后训练LLMs的双对齐校准器
机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) ; School of Computing, National University of Singapore(计算学院,新加坡国立大学) ; Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出Dual-Align方法,通过双对齐策略校正后训练LLMs的置信度漂移和过程漂移,提升校准性能。
屏蔽的推荐强化学习:无需降级的推荐系统解释生成
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG
AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。
零和博弈中的无正则化线性收敛性:从偏好反馈出发
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; HKUST(香港科技大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。
Comments 28 pages
MUSIC: 多步指令对比用于多轮奖励模型
机构 * Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。
并非所有标记都旨在被遗忘
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG
AI总结 本文提出TIF框架,通过目标信息标识符和偏好优化方法,解决LLM过度遗忘问题,提升去学习效果并保持模型效用。
C2PO:诊断和解构大语言模型中的偏见捷径
机构 * Jinan University(济南大学) ; Nanyang Technological University(南洋理工大学) ; Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) ; Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。
评估GRPO和DPO在LLM中的忠实链式推理能力
机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。
PPO-Clip算法的非渐近全局收敛性
机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) ; School of Mathematical Sciences, Peking University(北京大学数学学院) ; Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) ; Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG
AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。
D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制
机构 * IIIT Delhi(印度理工学院德里分校) ; Microsoft(微软) ; Apple (USA)(苹果(美国)) ; Google (USA)(谷歌(美国)) ; Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG
AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。
QiMeng-SALV:面向Verilog代码生成的信号感知学习
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG
AI总结 QiMeng-SALV通过信号感知学习提升Verilog代码生成的准确性与性能,采用信号级优化解决功能奖励不足问题。
Comments Accepted to NeurIPS 2025