MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 后训练与偏好优化 :language model(title);分类 cs.CL
Comments Accepted to EMNLP 2025 (Main)
机构 * ByteDance FanQie(字节跳动FanQie)
专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学) ; New York University(纽约大学) ; George Washington University(乔治华盛顿大学)
专题命中 后训练与偏好优化 :language model(title);分类 cs.AI
专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL
Comments Accepted to ICASSP 2025
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
Comments Accepted to ICASSP 2024
专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.LG
Comments Accepted by ICML 2024(Oral)
专题命中 后训练与偏好优化 :language model(title);分类 cs.CL
Comments NeurIPS 2023
专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL
Comments preprint
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
Comments Accepted to ICLR2022
专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG
学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法
机构 * University of Florida(佛罗里达大学) ; UC San Diego(加州大学圣迭戈分校) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; Universität Innsbruck(因斯布鲁克大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。
Comments 14 pages, 2 figures
PEER:统一的过程-结果强化学习用于结构化共情推理
机构 * Shandong University(山东大学) ; Shandong Jianzhu University(山东建筑大学) ; Singapore Management University(新加坡管理大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。
Comments 15 pages, 8 figures
DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练
机构 * Tsinghua University(清华大学) ; ENS Paris-Saclay(巴黎-萨克雷大学) ; Beike Language and Intelligence(贝克语言与智能)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。
MARS:面向奖励建模的边界与语义感知数据增强
机构 * University of Arizona(亚利桑那大学) ; Northeastern University London(伦敦东北大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。
基于组去偏联邦学习的偏好异质性下大语言模型个性化奖励建模反思
机构 * Institute of Engineering Research, Korea University(韩国大学工程研究所) ; Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金在哲人工智能研究生院) ; Industrial Management Engineering, Korea University(韩国大学产业管理工程学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对大语言模型个性化奖励建模的偏好异质性问题,提出FedGD方法,通过组去偏的客户端采样抵消组不平衡影响,实现无需预先知晓潜在组的有效个性化。
面向电商图像生成的元素感知组学习
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
基于低帧率高维连续标记的稳定自回归语音生成
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对自回归语音生成的序列长度、表征容量与长时稳定性平衡难题,本文提出Locodec编解码器与MP-ELD流匹配框架,实现高保真、高可预测性且稳定的长时语音合成。
FinSMART:基于市场对齐强化学习的算法交易金融情感分析
机构 * Imperial College London(帝国理工学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 FinSMART是首个基于市场对齐强化学习的金融情感分析框架,通过市场感知数据过滤与非对称交易奖励优化情感信号,在交易回报等指标上较基线提升220%,可自适应市场动态。
ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。
ReCo:针对分布集中问题的GRPO重加权方法
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。
MAPO:混合优势策略优化用于长时多轮对话
机构 * NatureSelect ; Tsinghua University(清华大学) ; South China Normal University(华南师范大学) ; Xiamen University(厦门大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 MAPO通过混合优势策略优化,利用密集过程反馈和多级归一化,提升长时多轮对话的稳定性和性能,优于传统方法。
超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者
机构 * East China Normal University(华东师范大学) ; Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司) ; Shanghai Normal University(上海师范大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对教育场景中LLMs直接作答问题,提出HeuristicEdu两阶段管道,经监督热身和GRPO,利用特定对话及启发式奖励训练Qwen2.5 - 7B,提升了支架有效性,降低关键词泄漏,表明规模并非引发苏格拉底行为的唯一因素。
Comments 12 pages, 2 figures, 5 tables; includes an appendix
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
ISO:一种原生 RLVR 的优化栈
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UIUC(伊利诺伊大学香槟分校) ; Emory University(埃默里大学) ; Together AI(联合人工智能公司) ; Recursive Superintelligence Inc(递归超级智能公司) ; ELLIS Institute Tübingen(图宾根埃利斯研究所)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。
Comments Preprint
脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题
机构 * Meta AI ; Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。
Comments 24 Pages
RRPO:基于分层条件展开的参考相对策略优化
机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校) ; Adobe Research(Adobe研究院)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究提出RRPO,通过参考相对对比比较推广GRPO。用分层条件展开构建锚集,训练投影头定义对比优势,在策略优化中评估。不依赖任务真实验证器,在多种设置下有竞争力,优于弱监督基线,监督微调后有额外收益。
循环变压器内部状态中的关系偏好编码
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究循环变压器如何编码人类偏好,通过提取内部迭代状态训练轻量评估头,发现偏好关系性编码优于非线性方法,提出翻转测试作为必要诊断。