arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 20 篇

2602.07340 2026-05-22 cs.LG 92%

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control

通过选择性几何控制重新审视LLM安全对齐的鲁棒性

Yonghui Yang, Wenjian Tao, Jilong Liu, Xingyu Zhu, Junfeng Fang, Weibiao Huang, Le Wu, Richang Hong, Tat-Sent Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) ST Engineering Ltd., Singapore(新加坡ST工程有限公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16299 2026-05-22 cs.SE cs.AI 92%

ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization

ACE:通过对抗性单元测试生成和偏好优化的自进化LLM编码框架

Yixu Huang, Xinglei Yu, Zhongyu Wei

机构 * School of Data Science Fudan University(数据科学学院 复旦大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title);large language model(abstract);language model(abstract)

AI总结 本文提出ACE框架,通过基于求解器-对抗架构的执行中心监督,实现自进化代码生成,无需真实代码或外部奖励模型,实验表明其在CodeContests、MBPP和LiveCodeBench上均优于现有求解器-验证器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15338 2026-05-22 cs.LG cs.CL 91%

Discovering Implicit Large Language Model Alignment Objectives

发现隐式大语言模型对齐目标

Edward Chen, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出Obj-Disco框架,通过自动分解对齐奖励信号为可解释的目标,解决现有方法的不足,验证了框架在多种任务和模型上的鲁棒性,并发现潜在的对齐偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22074 2026-05-22 cs.LG cs.AI cs.CL 90%

From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

从推理链到可验证子问题:课程强化学习使LLM推理能够进行信用分配

Xitai Jiang, Zihan Tang, Wenze Lin, Yang Yue, Shenzhi Wang, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Qiuzhen College, Tsinghua University(清华大学 旗正学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SCRL框架,通过从参考推理链中生成可验证子问题,解决LLM推理中信用分配问题,提升了在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18721 2026-05-22 cs.LG cs.CL 87%

General Preference Reinforcement Learning

通用偏好强化学习

Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal, Arslan Chaudhry, Andreas Haupt, Sanmi Koyejo, Emily Fox, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22817 2026-05-22 cs.LG cs.AI cs.CL cs.NE 83%

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

向量策略优化:为多样性训练改进测试时间搜索

Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

机构 * MIT(麻省理工学院) Improbable AI Lab(Improbable AI 实验室) MIT-IBM Computing Research Lab(麻省理工-IBM 计算研究实验室) Sakana AI

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出向量策略优化(VPO)方法,通过训练策略以预测多样化的下游奖励函数,从而产生多样化的解决方案,以改进测试时间搜索的性能。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21654 2026-05-22 cs.LG cs.AI cs.CL 83%

Value-Gradient Hypothesis of RL for LLMs

强化学习中大语言模型的价值-梯度假说

Arip Asadulaev, Daniil Ognev, Karim Salta, Martin Takac

机构 * MBZUAI(穆斯林人工智能研究所)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出了一种价值-梯度视角来解释无评论强化学习方法在大语言模型后训练中的有效性,并通过分析actor更新和注意力机制中的自适应微分,提出了价值梯度信号和可达奖励空间的分解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12058 2026-05-22 cs.LG cs.AI 82%

Holder Policy Optimisation

Hölder Policy Optimisation

Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

机构 * University College London(伦敦大学学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 后训练与偏好优化 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HölderPO框架,通过Hölder均值统一token级概率聚合,解决固定聚合机制导致的训练崩溃与性能不足问题,理论证明不同p值对梯度集中度和方差的平衡作用,并通过动态退火算法实现训练周期内的p值调度,实验表明其在多个数学基准测试中取得更优的稳定性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21822 2026-05-22 cs.AI 81%

Implicit Safety Alignment from Crowd Preferences

从大众偏好中隐式安全对齐

Qian Lin, Daniel S. Brown

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究如何从大众偏好数据中提取共享的安全标准,并将其转移到下游强化学习任务中以规范智能体行为并确保安全。提出了一种基于大众偏好的安全强化学习框架,通过高级策略将安全对齐的技能组合起来,以安全地解决下游任务。

Comments Accepted to ICML 2026. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 81%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21496 2026-05-22 cs.LG cs.AI cs.CL 80%

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

HealthCraft: 一种用于急救医学的强化学习安全环境

Brandon Dent

机构 * GOATnote Inc.(GOATnote公司)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HealthCraft,首个公开的强化学习环境,用于在真实急救医学条件下奖励轨迹级安全,通过FHIR R4世界状态、24个MCP工具和双层评估标准,评估模型在急救任务中的安全性和性能,揭示了模型在多步骤工作流中的安全失败问题。

Comments 16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20246 2026-05-22 cs.LG cs.AI 79%

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Zhejiang Normal University(浙江师范大学) Shandong Normal University(山东省师范大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22632 2026-05-22 econ.GN q-fin.EC 78%

Position: The Pre/Post-Training Boundary Should Govern IP in Industry-Academia ML Collaborations

位置:预/后训练边界应主导产业学术ML合作中的知识产权

Dirk Bergemann, Soheil Ghili, Nitzan Mekel-Bobrov

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出PBOS合同模板,通过定义预训练和后训练成果的边界来解决产业学术ML合作中的知识产权问题,主张该模板应成为默认合同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22537 2026-05-22 cs.LG 77%

F-TIS: Harnessing Diverse Models in Collaborative GRPO

F-TIS: 利用多样化模型进行协作GRPO

Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer, Lydia Yiyu Chen

机构 * Gensyn University of Neuchatel(日内瓦大学内沙特尔分校) Gensyn(盖森) TU Delft(代尔夫特理工大学) University of Neuchatel(日内瓦大学内沙特尔分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文提出F-TIS方法,通过利用异构模型在协同GRPO训练中提高本地模型的学习效果,实现了高效的通信和一致的最终模型收敛,同时在某些情况下提升了模型在分布外任务上的泛化能力。

Comments Accepted to ICML 2026 Workshop Scalable Learning and Optimization for Efficient Multimodal AI Agents (SCALE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 77%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI 77%

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22413 2026-05-22 cs.CV 67%

From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding

从识别到推理:在现实世界收据文档理解上对齐和增强MLLMs

Yandi Wang, Libin Zhan, Ziwei Huang, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出ReceiptBench基准,通过四个层次化子任务提升收据信息提取的结构一致性,并提出两阶段训练框架GRPO,通过强化学习信号提升模型性能,实验证明其在复杂推理任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17602 2026-05-22 cs.AI cs.CV cs.LG 62%

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I: 一种用于文本到图像对齐的鲁棒基于规则的奖励模型

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoRubric-T2I,一种首个用于文本到图像生成的规则学习框架,通过自动合成和选择显式规则来指导视觉语言模型(VLM)法官。该方法通过合成偏好对的推理轨迹生成候选规则,并利用VLM法官在每种规则下对配对图像进行评分,产生配对规则评分差异用于偏好学习。通过ℓ1正则化逻辑回归精简器去除噪声和冗余规则,从而在少量标注偏好数据下生成高质量、可解释的奖励信号,并在多个图像奖励基准测试中优于现有奖励模型基线。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12623 2026-05-22 cs.CL cs.CV cs.LG 62%

DocAtlas: Multilingual Document Understanding Across 80+ Languages

DocAtlas: 跨80多种语言的多语言文档理解

Ahmed Heakl, Youssef Mohamed, Abdullah Sohail, Rania Elbadry, Ahmed Nassar, Peter W. J. Staar, Fahad Shahbaz Khan, Imran Razzak, Salman Khan

机构 * MBZUAI(穆罕默德·本·拉谢德人工智能研究所) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DocAtlas框架,通过构建高保真的OCR数据集和基准测试,覆盖82种语言和9个评估任务,利用双重管道生成精确的结构注解,展示了直接偏好优化在多语言适应中的有效性,提升了领域内和领域外的准确率。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22703 2026-05-22 cs.LG 57%

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

剪裁瓶颈:通过近边界信号的随机恢复稳定RLVR

Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)中由于硬剪裁决策导致的训练不稳定问题,提出了一种名为近边界随机救援(NSR)的简单方法,通过随机保留略微超出边界范围的token来恢复丢失的信号,从而提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏