RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
专题命中 后训练与偏好优化 :foundation model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG
Comments ICML 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :foundation model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG
Comments ICML 2024
专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments Accepted at ICML 2023 main conference
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.AI、cs.LG
Comments Added experiments
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments 19 pages, 6 figures, 21 tables
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments Presented at ICLR 2024
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 24 pages, 41 figures
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments INTERSPEECH 2020
基于变分学习的RLVR参数探索
机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) ; National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。
GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。
DPO-F+:使代码修复反馈与开发者偏好对齐
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。
Comments 10 pages, 2 figures
基于近似查询处理和代理模型的AI工作流查询中心优化
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract)
AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。
具有人类反馈的分布鲁棒强化学习
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)
AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。
Comments Accepted at ICML 2026
校准的惊喜:一种信息论视角下的创造性质量
机构 * Bo Zou(邹波) ; Chao Xu(徐超)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种信息论框架,用于评估创造性写作的质量,通过校准的惊喜概念,结合香农互信息理论,量化了高质量文本与降质文本之间的差异。
Comments 28 pages, 3 figures
稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模
机构 * Saarland University(萨尔兰大学) ; Independent Researcher(独立研究者) ; Bielefeld University(比勒菲尔德大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。
“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。
Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity
ActiveUltraFeedback:使用主动学习的高效偏好数据生成
机构 * University of Freiburg(弗赖堡大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。
Comments 40 pages, 9 figures, 26 tables
GrepSeek:训练用于直接语料库交互的搜索代理
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。
解耦推理与置信度:在可验证奖励的强化学习中恢复校准
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) ; National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对RLVR中模型校准退化问题,提出DCPO框架通过解耦推理与校准目标,在保持准确率的同时显著改善校准性能并缓解过度自信。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
无奖励的冲突目标对齐
机构 * Columbia University(哥伦比亚大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RACO框架,通过冲突规避梯度下降的裁剪变体直接利用成对偏好数据解决多目标冲突,实现帕累托最优对齐。
Comments Accepted to ICML 2026 (Oral)
向量策略优化:为多样性训练改进测试时间搜索
机构 * MIT(麻省理工学院) ; Improbable AI Lab(Improbable AI 实验室) ; MIT-IBM Computing Research Lab(麻省理工-IBM 计算研究实验室) ; Sakana AI
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出向量策略优化(VPO)方法,通过训练策略以预测多样化的下游奖励函数,从而产生多样化的解决方案,以改进测试时间搜索的性能。
Comments 24 pages
强化学习中大语言模型的价值-梯度假说
机构 * MBZUAI(穆斯林人工智能研究所)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 本文提出了一种价值-梯度视角来解释无评论强化学习方法在大语言模型后训练中的有效性,并通过分析actor更新和注意力机制中的自适应微分,提出了价值梯度信号和可达奖励空间的分解方法。
Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器
机构 * Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(abstract)
AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。