Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
Comments AAAI 2025
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2024
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at BNAIC 2024
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Working Paper
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2024 camera ready
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Proceedings of the 41st International Conference on Machine Learning (ICML 2024)
专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages, 6 tables, 3 Figures, 3 Algorithms
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by CVPR 2024
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in TMLR: https://openreview.net/forum?id=xo3hI5MwvU
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
Comments 13 pages, 3 figures, 5 tables
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 26 pages, 15 figures
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments for associated data visualizations, see https://www.evals.anthropic.com/model-written/ for full datasets, see https://github.com/anthropics/evals
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments The First Workshop on Learning with Natural Language Supervision at ACL 2022
Polaris:基于检索反馈学习生成表格描述
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL
AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。
Comments 22 pages, 6 figures
为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因
机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) ; Centro de Investigación en Computación (CIC)(计算机研究中心)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
BridgeAlign:面向人文社科的偏好对齐框架
机构 * Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。
在弱到强对齐中评估风险:从偏差-方差视角出发
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; InstaDeep ; New York University(纽约大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.AI
AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。
替代更新何时能改进决策?轨迹式迁移的局部理论
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG
AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。
Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer
基于人类反馈的强化学习
机构 * Nathan Lambert(纳瑟恩·拉姆伯特)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);instruction tuning(abstract);post-training(abstract)
AI总结 本书系统介绍强化学习从人类反馈的核心方法,涵盖指令微调、奖励模型训练及拒绝采样等关键技术,探讨合成数据与评估中的前沿问题。
Comments 239 pages. Web-native version at https://rlhfbook.com/ Continually improving, latest version at website
Agentic-DPO:从专家轨迹上的模仿到智能体策略优化
机构 * Johns Hopkins University(约翰·霍普金斯大学)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。