arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2608.03119 2026-08-05 cs.AI 新提交 70%

Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

请勿偷看答案:用于无标签RLVR的结果掩码组相对策略优化

Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对无标签RLVR中模型易强化答案标记的问题,提出OM-GRPO框架,解耦奖励估计与策略优化,结合对比增强奖励,在多推理基准及测试时训练场景中性能优于现有方法。

Comments 25 pages, 16 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 70%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27686 2026-07-31 cs.AI 新提交 70%

Evaluating and Pricing Advertisements in AI-Generated Responses

评估和定价AI生成响应中的广告

John L. Turner-Smith, Zimeng Huang, Yuhan Fu, Yihang Zhang, Tonghan Wang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27562 2026-07-31 cs.AI 新提交 70%

DeepResearch Agent System

DeepResearch 智能体系统

Yong Huang, Yulu Huang, for the team Collaboration

机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26795 2026-07-30 cs.CL 新提交 70%

When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison

基于跨度引导的解毒方法何时有效?受控比较中的人类偏好与评估者诊断

Kyungwon Park

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究对比跨度引导与无引导解毒方法的人类偏好,发现二者存在权衡,不同分层偏好不同,自动评估无法替代人类判断,推动了新评估协议的发展。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23364 2026-07-28 cs.LG 新提交 70%

On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards

关于使用结果奖励进行无偏且长度不变的策略优化的不可能性

Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming Yang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在标准结果奖励+GRPO设置下,无基于长度的加权方案能同时兼具梯度无偏性与长度不变性。通过参数族刻画权衡谱,揭示GRPO和Dr. GRPO各有优劣,处于不可避免的权衡两端,都非完美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21626 2026-07-27 cs.AI 新提交 70%

Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control

离散动作空间是小模型连续控制中GRPO收敛的前提条件

Dmytro Filatov, Valentyn Fedorov, Vira Filatova

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 研究GRPO对小语言模型用于四旋翼连续控制任务微调的情况,发现普通GRPO微调失败,两项消融实验虽防熵崩溃但无法学习,更换动作接口后训练收敛,描绘出帕累托前沿,该方法在三个模型上评估,还对比了经典基线并发现训练分布差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20082 2026-07-23 cs.CL 新提交 70%

The Two-Process Theory of Machine Self-Report

机器自我报告的双过程理论

Hubert Plisiecki, Filip Chmielewski, Kacper Dudzic, Anna Sterna, Karolina Drożdż, Marcin Moskalewicz

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究针对语言模型自我报告缺乏有效方式的问题,提出双过程理论,通过角色设定和归因门控反映自我报告结构。经量表操作化及测试,发现训练后维度变化,表明其非固定属性,为语言模型自我报告研究提供新理论与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19044 2026-07-22 cs.LG 新提交 70%

Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation

采用具有可验证奖励的强化学习进行分子生成

Mingxuan Ouyang, Hao Lan, Wanyu Lin

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用大语言模型进行分子生成时面临的问题,提出LLMol框架,采用监督学习与强化学习结合的两阶段训练范式,引入RLVR及GRPO算法,有效处理多种分子设计任务,实验证明其性能优于现有方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16850 2026-07-21 cs.CL 新提交 70%

Group Entropy-Controlled Policy Optimization

组熵控制策略优化

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型强化学习中异构任务的探索利用问题,提出组熵控制策略优化(GEPO)方法,利用组熵进行优势塑造,通过实验验证该方法优于GRPO等,能实现跨任务平衡改进并保持任务探索水平。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16263 2026-07-21 cs.LG cs.CE q-bio.QM 新提交 70%

Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision

基于偏好的抗体表达排序:大规模弱监督下的扩展

Josh Qixuan Sun, Morteza Babaie, Wenyang Hou, Mark Crowley, David Young

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 研究针对抗体表达排序中标记数据稀缺问题,提出基于偏好的学习框架,结合定量表达与弱监督,通过改进DPO适用于蛋白质语言模型,在多样数据集上评估,该方法优于基线,为抗体可表达性优化提供可扩展方案。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交 70%

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10891 2026-07-14 cs.AI 新提交 70%

SETA: Scaling Environments for Terminal Agents

SETA:终端智能体的扩展环境

Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院) SambaNova(桑巴诺瓦公司) KAUST(阿卜杜拉国王科技大学) Stanford University(斯坦福大学) University of Oxford(牛津大学) University of Waterloo(滑铁卢大学) RadixArk(基数方舟公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交 70%

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 70%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 70%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04590 2026-07-07 cs.AI 新提交 70%

Attention Limited Reward Learning

注意力受限奖励学习

Wenqian Xing

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过基于理性注意力不集中的简化模型,探讨标准奖励建模中遗漏的内容,分离两种模糊性,指出有限注意力会扭曲成对比较结果,学习受标签携带的关注信息量而非数量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 70%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 70%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30789 2026-07-02 cs.LG stat.ML 新提交 70%

Predictable GRPO: A Closed-Form Model of Training Dynamics

可预测的GRPO:训练动力学的闭式模型

Rajat Ghosh, Datta Nimmaturi, Aryan Singhal, Vaishnavi Bhargava, Henry Wong, Johnu George, Debojyoti Dutta

机构 * Nutanix Unsloth

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GRPO训练动力学的第一性原理降阶模型,揭示其指数饱和律的物理含义,预测群大小不变性、稳定性阈值和过阻尼-振荡转变,并在多个模型和基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27739 2026-06-29 cs.LG 新提交 70%

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

最薄弱的环节说明一切:通过可学习信用分配的结果监督过程奖励建模

Tianyu Jia, Yue Fang, Hongxin Ding, Rihong Qiu, Zhibang Yang, Zhijing Wu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LCA框架,通过可学习信用分配解决结果监督过程奖励模型中的信用分配问题,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27291 2026-06-26 cs.LG 新提交 70%

Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

设计便携查询生成的奖励信号:工业语义职位搜索案例研究

Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出RLAIF框架生成便携职位搜索查询,通过奖励塑造解决策略优化中的奖励黑客问题,实验表明稳健奖励设计比优化器选择更关键。

Comments Accepted to KDD 2026 Workshop on AI Agent for Information Retrieval (Agent4IR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23595 2026-06-23 cs.AI 新提交 70%

SPIRAL: Learning to Search and Aggregate

SPIRAL: 学习搜索与聚合

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21830 2026-06-23 cs.LG 新提交 70%

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Mat-Pref: 可验证奖励训练提升无机材料中的组合推理能力

Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出Mat-Pref基准,通过可验证奖励强化学习(GRPO)提升无机材料组合推理,在结构泛化和属性迁移上超越大模型。

Comments 10 pages, 4 figures, Accepted at ICML AI4Physics 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20008 2026-06-19 cs.LG 新提交 70%

VIMPO: Value-Implicit Policy Optimization for LLMs

VIMPO: 值隐式策略优化用于大语言模型

Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14510 2026-06-19 cs.LG q-bio.BM 新提交 70%

PepALD: Macrocyclic Peptide Generation via Autoregressive Latent Diffusion

PepALD: 通过自回归潜在扩散生成大环肽

Junming Zhang, Siyu Yi, Wei Ju, Zhonghui Gu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Mathematics, Sichuan University(四川大学数学学院) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院) Lingang Laboratory(临港实验室)

专题命中 后训练与偏好优化 :foundation model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 提出PepALD模型,结合自回归潜在扩散与化学嵌入,实现从头设计大环肽,并利用偏好优化提升亲和力,在生成质量和奖励优化上优于基线。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18988 2026-06-18 cs.AI 新提交 70%

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架

Jinhao Song, Shan Liang, Yiqun Yue, Zhuhuayang Zhang, Tianqi Gao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。

Comments 10pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 70%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13795 2026-06-18 cs.LG 新提交 70%

DiPOD: Diffusion Policy Optimization without Drifting Apart

无漂移扩散策略优化

Haozhe Jiang, Haiwen Feng, Pieter Abbeel, Jiantao Jiao, Angjoo Kanazawa, Nika Haghtalab

机构 * University of California, Berkeley(加州大学伯克利分校) Simons Institute for the Theory of Computing(西蒙斯计算理论研究所) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 针对扩散策略梯度方法的不稳定性,提出DiPOD框架,通过自蒸馏与策略改进梯度更新交替进行,维持紧界行为,实现稳定且高效的策略优化。

Comments Project page: astro-eric.github.io/blogs/dipod/ Code: https://github.com/Astro-Eric/DiPOD-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17053 2026-06-16 cs.CL cs.CV 新提交 70%

Context-Aware RL for Agentic and Multimodal LLMs

上下文感知强化学习用于智能体与多模态大语言模型

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

机构 * Princeton University(普林斯顿大学) UC Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏