arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 19 篇

2505.19241 2026-05-18 cs.LG cs.AI 90%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title);large language model(abstract);language model(abstract)

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15464 2026-05-18 cs.LG cs.AI cs.CL 89%

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

GRLO:从零开始在开放环境中的通用强化学习

Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00778 2026-05-18 cs.LG 85%

What Is Preference Optimization Doing, and Why?

偏好优化在做什么,为什么这样做?

Yue Wang, Qizhou Wang, Zizhuo Zhang, Gang Niu, Bo Han, Masashi Sugiyama

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) RIKEN AIP(理化学研究所 AIP 分室) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文分析了偏好优化中DPO和PPO的优化动态,揭示了其算法行为差异及根本原因,探讨了正学习、负学习和损失再加权的作用,并通过消融研究验证了这些动态对优化效率和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG 84%

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06062 2026-05-18 cs.CL 84%

When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL

重要采样误分配信用:用于结果监督强化学习的非对称比率

Jiakang Wang, Runze Liu, Qingpeng Cai, Lei Lin, Wenping Hu, Xiu Li, Fuzheng Zhang, Guorui Zhou, Kun Gai, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15573 2026-05-18 cs.CL cs.LG cs.MA 82%

Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems

响应条件化的并行到顺序 orchestration 用于多智能体系统

Nurbek Tastan, Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane, Samuel Horvath, Karthik Nandakumar

机构 * MBZUAI(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Nexa框架,通过响应条件化的策略结合并行与顺序执行,减少通信和延迟同时提高最终响应准确性,展示了其通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00920 2026-05-18 cs.CL 81%

Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios

奖励审计员:在现实扰动场景中对奖励建模适用性的推断

Jianxiang Zang, Yongda Wei, Ruxue Bai, Shiyu Jiang, Nijia Mo, Binhong Li, Qiang Sun, Hui Liu

机构 * School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海国际商务经济学院统计与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出奖励审计员框架,用于评估奖励模型在现实扰动场景中的适用性,通过统计显著性和效应量分析模型的可靠性与漏洞严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15803 2026-05-18 cs.CV cs.LG 79%

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06239 2026-05-18 cs.LG 79%

Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution

可证明地避免在不了解数据分布的情况下直接偏好优化中的过度优化

Adam Barla, Emanuele Nevali, Luca Viano, Volkan Cevher

机构 * EPFL(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 PEPO通过训练不同数据子集的偏好优化策略并聚合最坏情况,避免了过度优化问题,其样本复杂度仅依赖单策略集中性系数,保持了DPO的简洁性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12667 2026-05-18 cs.LG cs.AI 79%

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

ODRPO:离散奖励的序分解以实现鲁棒策略优化

Nirmal Patel, Fei Wang, Inderjit S. Dhillon

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODRPO框架,通过将离散奖励分解为序二进制指标,减少噪声影响,提升策略优化鲁棒性,实验表明在Qwen2.5-7B和Qwen3-4B模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG 76%

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.LG

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15224 2026-05-18 cs.AI cs.MA 70%

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

ICRL: 通过强化学习学习内化自我批评

Jianbo Lin, Xiaomin Yu, Yi Xin, Yifu Guo, Zhuosong Jiang, Zhongqi Yue, Weishi Wang, Heqing Zou, Chengwei Qin, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) SAP Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过联合训练求解器和批评者,使求解器在无外部批评时也能自我改进,提升代理和数学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15204 2026-05-18 cs.AI 70%

SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch

SDOF:通过状态约束调度驯服多智能体编排中的对齐税

Zhantao Wang

机构 * Digital China(数字中国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 SDOF通过状态约束调度框架,利用强化学习和有限状态自动机提升多智能体任务执行的准确性和可控性,验证了其在招聘系统中的有效性。

Comments 12 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15325 2026-05-18 cs.CV 67%

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA:基于强化学习的条件参数适应用于视频异常检测

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

机构 * Auburn University(奥本大学) Tencent Hunyuan(腾讯文元)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 COPRA通过生成输入特定的参数更新,动态适应冻结的VLM,提升视频异常检测的适应性和泛化能力,同时拓展到多选视频问答和密集标注等任务。

Comments Manuscript currently under review for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16154 2026-05-18 cs.LG cs.RO 57%

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

学习结果分歧之处:通过概率块掩码实现高效的VLA强化学习

Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出概率块掩码(PCM),通过选择性分配梯度计算来提升GRPO-based VLA RL的效率,实现更快的训练速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16246 2026-05-18 stat.ME stat.ML 50%

FRESH: Information-Geometric Calibration of Patient-Level Models to Aggregate Evidence

FRESH:信息几何校准患者级模型以聚合证据

Franklin Fuller, Daniele Bertolini, Samantha Liang, Jason Christopher, Aaron M. Smith

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 FRESH通过信息几何方法将群体层面结果与患者层面数据结合,提升临床决策模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15951 2026-05-18 cs.CV 50%

From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

从失败到反馈:群体修订解锁对象级 grounding 的难题

Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。

Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02491 2026-05-18 eess.SP 50%

Lightweight Diffusion Models for Resource-Constrained Semantic Communication

轻量级扩散模型用于资源受限的语义通信

Giovanni Pignata, Eleonora Grassucci, Giordano Cicchetti, Danilo Comminiello

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出Q-GESCO框架,通过量化扩散模型减少计算和内存负载,实现语义通信的高效再生,节省75%内存和79%浮点运算。

Journal ref IEEE Wireless Communications Letters, volume 14 issue 9, september 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18719 2026-05-18 cs.CV 50%

Seeing What Matters: Visual Preference Policy Optimization for Visual Generation

看见重要之物:面向视觉生成的视觉偏好策略优化

Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出ViPO,一种改进的GRPO方法,通过结构化像素级优势图提升视觉生成的对齐和泛化能力,优于传统GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏