Tool-Augmented Reward Modeling
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
Comments ICLR 2024 Spotlight
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
Comments ICLR 2024 Spotlight
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG
Comments 11 pages, 5 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG
Comments 10 pages, 5 figures,
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
Comments 59 pages, 5 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI
Comments 17 pages
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI
专题命中 后训练与偏好优化 :language model(abstract,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accept at the Conference On Language Modeling (COLM) 2025
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(comments)
Comments Accepted to IEEE IDS 2025 Special Track: Financial Reinforcement Learning and Foundation Models (FinRLFM). 3 pages, 2 figures, 3 tables
Journal ref Proc. of the 2025 IEEE 11th International Conference on Intelligent Data and Security (IDS)
专题命中 后训练与偏好优化 :language model(abstract,comments);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Proceedings of Conference on Language Modeling (COLM 2024)
VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示
机构 * Peking University(北京大学) ; PrimeBot
专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL、cs.AI
AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。
Comments accepted by ACM MM 2026
偏好优化的归一化奖励
专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI、cs.LG
AI总结 研究针对直接对齐算法过度优化隐式奖励模型的问题,提出添加正则化项的方法,通过研究似然变化分布理解过度优化,应用该正则化于相关方法,实现生成质量与基准能力权衡及奖励建模改进,提升了模型性能。
Comments ICML 2026
ExTra: 面向语言模型强化学习的探索性轨迹优化
机构 * National University of Singapore(新加坡国立大学) ; SAP
专题命中 后训练与偏好优化 :language model(title);分类 cs.AI、cs.LG
AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。
Comments 15 pages
平衡GRPO自回归文本到图像后训练中的性能与多样性
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG
AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。
Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯文言)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG
AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。
超越GRPO和在线策略蒸馏:一种经验性稀疏到密集奖励原则用于语言模型后训练
专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种经验性的稀疏到密集奖励原则,用于语言模型后训练,通过在教师模型上使用稀疏奖励进行探索和发现,然后通过密集监督将行为压缩到部署模型中,从而在数学问题上实现了优于GRPO的性能。
TemplateRL: 结构化模板引导的强化学习用于大语言模型推理
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Princeton University(普林斯顿大学) ; Shanghai AI Lab(上海人工智能实验室) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.LG
AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。
Comments Accepted by ACL 2026
信任批量,策略上或下策略:训练后强化学习的自适应策略优化
机构 * Boson AI
专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG
AI总结 本文提出一种自适应策略优化方法,通过动态调整策略更新的信任区域和下策略正则化强度,以提高强化学习在训练后对数据分布变化的鲁棒性。
当政策无法再训练时:一种统一的闭式视图的离线强化学习后训练引导
机构 * College of Engineering and Computer Science(工程与计算机科学学院)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG
AI总结 研究探讨了在离线强化学习中,冻结的演员在部署时通过专家产品组合与目标条件先验进行适应,发现精度加权组合在退化或随机先验下仍能保持冻结演员的稳定性,而其他方法失效。同时揭示了在冻结演员设置下,PoE与KL正则化适应的闭式恒等式。
为什么RLHF对齐是浅层的?一种梯度分析
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
专题命中 后训练与偏好优化 :RLHF(title);分类 cs.CL、cs.LG
AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。
让它们轻松一些!LLM护栏对用户感知和偏好的情境影响
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Simon Fraser University(西蒙弗雷泽大学) ; Allen Institute for AI(人工智能研究所)
专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.AI
AI总结 研究探讨了LLM护栏对用户感知和偏好的影响,发现部分合规策略能显著降低负面感知,强调应通过创造性的拒绝策略而非意图检测来提升安全性和用户体验。
Comments Accepted to Findings of EMNLP 2025
机构 * Central South University(中南大学) ; Shanghai Maritime University(上海 Maritime 大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学) ; SenseTime Research(商汤科技研究院) ; University of Sydney(悉尼大学) ; Hong Kong University of Science(香港科学大学)
专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI、cs.LG
机构 * Qiyuan Tech(启元科技) ; Renmin University(中国人民大学)
专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.LG
Comments v2: sp for vlms; code at https://github.com/Qihoo360/360-LLaMA-Factory
专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI
Comments Accepted at The 3rd Intl. Workshop on NL-based Software Engineering, 2024
SSR-GRPO:将监督与语义标识符集成到强化学习中用于电商领域的密集检索
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对电商嵌入检索的语义处理难题,提出SSR-GRPO模型,通过双视角相关性评估、难负样本挖掘等策略优化R-GRPO,经实验验证有效并已部署于大规模电商平台。
Falcon Perception-HD:基于强化学习的高密度感知
机构 * Tübingen AI Center(蒂宾根人工智能中心) ; University of Tübingen(蒂宾根大学) ; MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) ; Technology Innovation Institute(技术创新研究院)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)
AI总结 该研究针对开放词汇自回归感知模型的目标错位问题,基于Falcon Perception设计RL框架,采用GRPO优化,在指代表达分割任务上提升了极密集场景性能,减少冗余需求并保留物体存在性知识。
Comments 27 pages, 11 figures
RobustFlow:面向鲁棒智能体工作流生成
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 针对现有智能体工作流生成方法对语义等价不同表述指令鲁棒性不足的问题,提出RobustFlow系统,结合偏好优化与专用基准,在多扰动下鲁棒性得分70%--90%,优于AFlow、ScoreFlow等方法。
HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成
机构 * Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract)
AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。
Comments 31 pages
用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型
机构 * Intuit(英图易(金融科技公司))
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。
自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。
Comments 13 pages, 3 figures
带有观测校准自蒸馏的智能体强化学习
机构 * Meituan(美团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。