Offline Regularised Reinforcement Learning for Large Language Models Alignment
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments 11 pages, 6 figures
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Published as a conference paper at CVPR 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments 23 pages, 5 figures
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
Comments WWW 2024
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
Comments Presented at AAAI 2024 RL+LLMs Workshop
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
Comments 22 pages, 8 figures, accepted at ICLR24
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(title);large language model(abstract);language model(abstract)
Comments Project Page: https://mm-rlhf.github.io/
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
EvoRIC:面向自主O-RAN的、由强化学习微调大语言模型赋能的RAN智能控制器
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 针对传统RAN智能算法泛化差、通用LLM算力高且缺领域知识的问题,提出EvoRIC分层框架,结合RLFT与PPO优化LLM,在IAB网络中验证其泛化性与效能,为自主O-RAN提供新方案。
Comments Manuscript submitted 23 April 2026; revised 7 August 2026
通过选择性预测使语言模型对齐
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) ; Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) ; University of Minnesota Twin Cities(明尼苏达大学双城分校)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)
AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。
Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR
ASSCG:自动驾驶中快慢LLM规划的恰到好处门控
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Lenovo Group Limited(联想集团)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。
直接偏好优化综述:数据集、理论、变体及应用
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 综述直接偏好优化(DPO)在理论、变体、数据集和应用方面的进展,指出其作为RL-free替代方案的潜力与局限,并提出未来研究方向。
Comments Accepted by TPAMI 2026. Project page: https://github.com/Mr-Loevan/DPO-Survey
RLHF 可能不反映真实偏好
专题命中 后训练与偏好优化 :RLHF(title,title_cn)
AI总结 本文指出 RLHF 中的标注响应可能并非真实偏好,通过提出测量有效性诊断方法,发现不一致性具有系统性偏差,过滤高不一致标注者会显著改变模型输出。
学习通过A*后训练进行高效推理
机构 * ETH Zürich(苏黎世联邦理工学院) ; MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所) ; Purdue University(普渡大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);post-training(title);large language model(abstract);language model(abstract)
AI总结 本文通过A*搜索算法指导LLM生成正确且高效的推理步骤,提出监督微调和强化学习两种训练方法,在1B-3B参数模型上显著提升推理准确性和效率。
Comments Preprint
为企业软件工程定制LLM
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract)
AI总结 本文提出Gemini for Google,一种专为企业内部软件工程生态系统定制的LLM,通过端到端开发和中间训练策略,显著提升了开发效率和代码存活率,为其他组织提供了可复制的数据利用路径。
Comments 11 pages, 8 figures
当策略熵约束失效时:通过感知熵在基于流的RLHF中保持多样性
机构 * Southeast University(东南大学) ; Tencent Youtu Lab(腾讯云图实验室) ; Southern University of Science and Technology(南方科技大学)
专题命中 后训练与偏好优化 :RLHF(title,title_cn)
AI总结 本文研究了基于流的RLHF中策略熵与多样性之间的关系,提出感知熵作为新的约束方法,通过在感知空间中保持多样性提升模型质量。
指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量
机构 * University of Maryland(马里兰大学) ; Allen Institute for AI(Allen人工智能研究所)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。
Comments ACL2026, camera-ready
Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) ; Caltech(加州理工学院) ; RPI(罗切斯特理工学院) ; MBZUAI(澳门大学人工智能研究院) ; University of Chicago(芝加哥大学) ; NEC Laboratories America(NEC美国实验室)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 ACTOR-CURATOR通过策略改进带状机实现RL后训练的联合适应课程学习,有效提升训练稳定性和效率。
Comments 37 pages, 8 figures, 1 table. Preprint under review. Equal contribution by first two authors
机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Stony Brook University(石溪大学) ; Institute for Advanced Computational Science(先进计算科学研究所) ; Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) ; AI Innovation Institute(人工智能创新研究院) ; Bloomberg(彭博) ; Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) ; San Francisco, CA 94105(旧金山,CA 94105) ; Bloomberg New York, NY 10022(纽约,NY 10022)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构 * University of Maryland, College Park(马里兰大学学院 park)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输联合实验室,(北京交通大学)教育部) ; School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(计算机科学与技术学院,北京交通大学,北京,中国) ; Tencent Inc, China(腾讯公司,中国)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)
Comments ACL 2025 Main Conference, code available at: https://github.com/songmzhang/AlignDistil
机构 * MoE Key Lab of BIPC, University of Science(BIPC联合实验室,科学与技术大学) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
机构 * The University of Tokyo(东京大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments ICML 2025 Workshop on Models of Human Feedback for AI Alignment
机构 * IIIS, Tsinghua University, Beijing, China(清华大学信息科学技术学院,北京,中国) ; Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国) ; Department of Computer Science, University of California, Los Angeles, California, USA(计算机科学系,加州大学洛杉矶分校,美国,加州)
专题命中 后训练与偏好优化 :language model(title,abstract);foundation model(abstract);post-training(abstract);RLHF(abstract)
Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)