arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2607.01392 2026-07-07 cs.CL 新提交 85%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交 85%

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12590 2026-06-12 cs.CV cs.AI 新提交 85%

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

分析与改进医学LVLMs中的细粒度偏好优化

Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Queen’s University(女王大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10860 2026-06-10 cs.CR cs.CL 新提交 85%

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

训练LLM通过重力加权直接偏好优化强制执行多级指令层次结构

Lena S. Bolliger, Lena A. Jäger

机构 * Department of Computational Linguistics, University of Zurich, Switzerland(计算语言学系,苏黎世大学,瑞士)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);preference optimization(title);分类 cs.CL

AI总结 提出重力加权DPO(GW-DPO)方法,通过线性或双边调度加权冲突级别间的结构距离,结合层次分隔符和指令段嵌入,在Llama-3.1-8B-Instruct上提升多级指令优先级遵守率并降低过度拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18163 2026-07-21 cs.LG cs.AI 新提交 85%

OR Else: A Differentiable Trust Region for Policy Optimization

OR 否则:用于策略优化的可微信赖域

Chinmay Rane, Kanishka Tyagi, Michael Manry

机构 * Quantiphi Inc(昆蒂菲公司) Self Machines Inc(自机器公司) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15306 2026-06-16 cs.LG cs.AI 新提交 85%

LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

LatentGym: 具有可控潜在结构的跨任务经验学习测试平台

Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

机构 * Columbia University(哥伦比亚大学) Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。

Comments 61 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06377 2026-08-07 cs.CL cs.AI cs.LG 新提交 85%

Learning When to Trust via Selective Context Preference Optimization

通过选择性上下文偏好优化学习何时信任

Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

机构 * Duke University(杜克大学) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Irvine(加州大学欧文分校) Northeastern University(东北大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。

Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 85%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21227 2026-07-24 cs.RO 新提交 85%

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

FORGE-plus:使用冻结的语言模型监督器进行力预算的富接触装配恢复

Kyupaeck Jeff Rah, Midum Oh

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究在规定力上限下实现紧间隙装配及从插入失败中恢复的问题,提出含冻结大语言模型的两层框架,该模型分配力上限并选恢复策略,通过实验评估,此框架表现良好,解决了部分夹具故障问题,也有负面结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18476 2026-07-22 cs.CL cs.AI cs.LG 新提交 85%

Structured Output Collapses Answer Diversity Across 44 Language Models

结构化输出会削弱44种语言模型的答案多样性

Tapan Parikh

机构 * Cornell Tech(康奈尔理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。

Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 85%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17171 2026-08-19 cs.CL cs.DB 新提交 84%

Polaris: Learning to Generate Table Descriptions from Retrieval Feedback

Polaris:基于检索反馈学习生成表格描述

Ting Cai, Tuan Minh Phan, AnHai Doan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL

AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15530 2026-08-18 cs.CL 新提交 84%

Why Summaries Turn Neutral: Policy Attribution for Sentiment Drift in Reinforcement Learning from Human Feedback

为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因

Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova, Grigori Sidorov

机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) Centro de Investigación en Computación (CIC)(计算机研究中心)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14791 2026-08-18 cs.AI 新提交 84%

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习

Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学) University of Tehran(德黑兰大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。

Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08046 2026-08-11 cs.AI 新提交 84%

JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

JustLLMGRPO:面向胸部X射线生成的放射学控制

Pengxiang Cai, Xiaohan Li, Anglin Liu, Qingyuan Zeng, Zexun Li, Jintai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 84%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01130 2026-08-04 cs.LG 新提交 84%

When Do Surrogate Updates Improve Decisions? A Local Theory of Trajectory-Wise Transfer

替代更新何时能改进决策?轨迹式迁移的局部理论

Yuyang Shen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。

Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10601 2026-07-14 cs.AI 新提交 84%

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO:从专家轨迹上的模仿到智能体策略优化

Yixiong Chen, Alan Yuille

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01964 2026-07-03 cs.CL 新提交 84%

Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing

超越有监督澄清:基于LLM的输入重写用于对话篇章解析

Yiming Liu, Ziyue Zhang, Zhichao Xu, Xin Yu, Yingheng Tang, Tianyu Jiang, Jie Cao

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。

Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16501 2026-06-16 cs.AI 新提交 84%

Post-Hoc Merging is Not Enough: Many-Shot Model Merging with Loss-Gap Balancing

事后合并是不够的:基于损失差距平衡的多轮模型合并

Kyungjin Im, Miru Kim, Chanin Eom, Minhae Kwon

机构 * Soongsil University, Republic of Korea(韩国顺斯大学) Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(成均馆大学电子与计算机工程系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出METIS方法,通过迭代多轮合并和任务损失差距加权,解决多任务模型合并中的信息擦除问题,显著提升最差任务性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11167 2026-06-10 cs.CL eess.AS 新提交 84%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08131 2026-06-09 cs.HC cs.AI 新提交 84%

LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

LCAM:诊断对话式AI中交互对齐失败的框架

Manuele Reani, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区管理学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 提出分层认知对齐模型(LCAM),通过五层对齐和两种失调极性诊断对话式AI的交互失败,应用于LLM咨询案例揭示潜在危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 84%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10196 2026-08-12 cs.LG cs.AI 新提交 84%

ELMER: Evolutionary Language Model that Explores and Refines

ELMER:探索与优化的进化语言模型

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。

Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 84%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20435 2026-07-24 cs.CL cs.AI 新提交 84%

Making Open-Source Text LLM Watermarks Durable Against Merging

使开源文本语言模型水印在合并后仍具耐久性

Luisa Scharff, Thibaud Gloaguen, Robin Staab, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究如何让开源文本语言模型水印在模型合并后仍具耐久性,提出合并对抗训练算法,该算法能将水印融入模型权重,在保留下游能力的同时优于所有基线,还评估了针对现实合并场景的水印,表明对抗训练可提高水印耐久性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 84%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13389 2026-07-16 cs.LG cs.CL 新提交 84%

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈

Patrick Wilhelm, Odej Kao

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 84%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 84%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏