COPR: Continual Learning Human Preference through Optimal Policy Regularization
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 22 pages, 5 figures, Submitted to ACL 2024
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2023
专题命中 后训练与偏好优化 :foundation model(abstract);RLHF(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2022 (34 pages), model checkpoints available at https://github.com/martiansideofthemoon/rankgen. Added comparisons to newer decoding methods (contrastive search, contrastive decoding, eta sampling)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
SEVerA: 验证合成自进化代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。
Comments First Formally Verified Self-Evolving LLM Agents
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 后训练与偏好优化 :language model(abstract,journal_ref);large language model(abstract);分类 cs.CL
Comments Accepted for publication at COLM 2025
Journal ref Second Conference on Language Modeling (COLM 2025)
专题命中 后训练与偏好优化 :language model(abstract,comments);pretraining(abstract);分类 cs.LG
Comments Published at the 2024 Conference on Language Modeling (CoLM)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL;RLHF(comments)
Comments EMNLP 2023 findings, Length Bias in RLHF, Mitigate bias in reward modeling
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL;instruction tuning(comments)
Comments NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following
BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化
专题命中 后训练与偏好优化 :preference optimization(title)
AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。
Comments 9 pages,4 figures
HarmRLVR: 利用可验证奖励进行有害大模型对齐
专题命中 后训练与偏好优化 :LLM(title)
AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。
基于区域感知双模态直接偏好优化的组合式文本到图像生成
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) ; Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)
专题命中 后训练与偏好优化 :preference optimization(title)
AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。
LucidNFT: 基于LR锚定的多奖励偏好优化用于基于流的现实世界超分辨率
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 后训练与偏好优化 :preference optimization(title)
AI总结 本文提出LucidNFT框架,通过引入LucidConsistency、解耦奖励归一化策略和LucidLR数据集,解决现实世界超分辨率中LR参考一致性、奖励优化瓶颈和真实退化覆盖不足的问题,提升感知质量。
LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐
机构 * The Australian National University(澳大利亚国立大学)
专题命中 后训练与偏好优化 :post-training(title)
AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。
Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/
人机协同:实时偏好优化
专题命中 后训练与偏好优化 :preference optimization(title)
AI总结 本文提出一种实时反馈优化控制器,通过成对比较反馈优化用户效用,保证最优性和闭环稳定性,通过随机探索信号估计下降方向,并通过数值实验验证理论结果。
TTRV:用于视觉语言模型的测试时间强化学习
机构 * IISc Bangalore(班加罗尔印度理工学院) ; JKU Linz(林茨约翰·凯撒大学) ; Stanford(斯坦福大学) ; Tübingen AI Center(图宾根人工智能中心) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; MIT CSAIL Project(麻省理工CSAIL项目)
专题命中 后训练与偏好优化 :language model(title)
AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。
机构 * Jilin University(吉林大学) ; Peking University(北京大学) ; Mininglamp Technology(Mininglamp科技)
专题命中 后训练与偏好优化 :LLM(title)
机构 * School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学,苏州,中国) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中 后训练与偏好优化 :preference optimization(title)
机构 * HSE University(俄罗斯高等经济大学) ; AIRI ; Sber AI ; Sber ; Innopolis
专题命中 后训练与偏好优化 :preference optimization(title)
Comments The first two authors contributed equally. The source code can be found at https://github.com/ControlGenAI/DreamBoothDPO
专题命中 后训练与偏好优化 :preference optimization(title)
大卫能否击败歌利亚?关于资源受限代理的多跳推理
机构 * ETRI(电子技术研究所) ; The University of Hong Kong(香港大学) ; Seoul National University(首尔国立大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出David-GRPO方法,通过结合专家引导和证据指导探索,提升小批量学习效果,在多跳问答基准上优于现有RL基线,使代理更深入检索并覆盖更多证据。
Comments Preprint
辩论训练可减少RLAIF中的奖励黑客行为
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出用辩论训练替代RLAIF基线,在数学任务中可减少奖励黑客行为,维持裁判性能并恢复45%的性能差距,还验证了多方面相关实验结论。
PlanPO:面向多轮智能体大语言模型的组规划感知策略优化
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。
伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理
机构 * Stony Brook University(石溪大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。