Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 34 pages
专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024 camera-ready
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint Version
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
Comments MM2024 oral
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages, 17 Figures, 8 Tables
专题命中 后训练与偏好优化 :foundation model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments weirdlabuw.github.io/vpl
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract)
Comments CVPR'24
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract)
Comments 14 pages, 3 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by TMLR
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 pages; data available, see https://sites.google.com/site/nhcollier/projects/art
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Oxford(牛津大学) ; Jagiellonian University(雅盖隆大学) ; Harvard University(哈佛大学)
专题命中 后训练与偏好优化 :language model(abstract,journal_ref);preference optimization(abstract);分类 cs.CL、cs.LG
Journal ref NeurIPS 2024 Workshop on Socially Responsible Language Modelling Research (SoLaR)
专题命中 后训练与偏好优化 :RLHF(abstract,comments);language model(abstract);分类 cs.CL、cs.LG
Comments Data available at https://github.com/anthropics/hh-rlhf
当遗忘失效时:智能体网络后训练下的可靠数据删除
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。
自监督在线策略蒸馏用于推理语言模型
机构 * Tsinghua University(清华大学) ; Beihang University(北航大学)
专题命中 后训练与偏好优化 :language model(title);分类 cs.LG
AI总结 本文提出自监督在线策略蒸馏(SSOPD)方法,通过对比正确与错误的完成过程信号,提升推理语言模型的表现,实验表明在多个基准测试中优于GRPO和OPSD基线。
离线约束强化学习中的多偏好Oracle
机构 * University of Iowa(爱荷华大学)
专题命中 后训练与偏好优化 :RLHF(title);分类 cs.LG
AI总结 本文基于多偏好Oracle研究离线约束强化学习,通过最大似然估计Oracle奖励并分析统计不确定性传播,将约束目标转化为KL-正则化拉格朗日函数,提出仅需对偶的算法以保证约束满足并提供有限样本性能保证。
隐式回合式策略优化用于主动用户-大语言模型交互
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Meta AI
专题命中 后训练与偏好优化 :LLM(title);分类 cs.LG
AI总结 本文提出隐式回合式策略优化方法,通过隐式过程奖励模型从稀疏结果信号中提取细粒度回合级奖励,提升多轮协作任务的训练稳定性与收敛性。
大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成
机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) ; Toyota Research Institute(丰田研究院)
专题命中 后训练与偏好优化 :language model(title);分类 cs.AI
AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。
奖励DINO:基于视觉基础模型预测密集奖励
机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) ; TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)
专题命中 后训练与偏好优化 :foundation model(title);分类 cs.LG
AI总结 本文提出Rewarding DINO,一种基于语言条件的奖励模型,通过学习实际奖励函数而非特定轨迹,实现机器人操作任务的密集奖励预测,具有紧凑结构和低计算开销,能有效泛化至新场景。
Comments 10 pages, 5 figures, submitted to IEEE
RRPO: 为基于LLM的情感TTS的鲁棒奖励策略优化
机构 * Speech Team, Tongyi Lab, Alibaba Group(通义实验室,阿里集团)
专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI
AI总结 RRPO通过鲁棒奖励模型和混合正则化方案,提升LLM情感TTS的鲁棒性和自然度,有效对抗奖励黑客攻击。
Comments Accepted by ICASSP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works
通过苏格拉底提问缩小LLM指令的表达差距
机构 * Nankai University(南开大学) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanda AI Research(上海沙达人AI研究所)
专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI
AI总结 通过苏格拉底提问方法,提出Nous代理以主动探测用户意图,解决人类与AI协作中的意图表达差距问题,提升效率和输出质量。
机构 * Discover Financial Services(Discover金融服务公司)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
Comments 45 pages, 4 figures