arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 24 篇

2606.30406 2026-06-30 cs.CL cs.LG 92%

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

MOPD: 面向LLM后训练中能力集成的多教师同策略蒸馏

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo

机构 * Peking University(北京大学) LLM Core Xiaomi(小米大模型核心团队) University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出多教师同策略蒸馏(MOPD)范式,通过先训练领域专家再在学生自生成数据上蒸馏,消除暴露偏差并提供密集优化信号,在Qwen3-30B-A3B上优于多种基线,并已部署于工业级模型MiMo-V2-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30445 2026-06-30 cs.LG 92%

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI 92%

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);language model(abstract)

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28524 2026-06-30 cs.CL 92%

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

Transformer语言模型中情境建模与心理推理的发展轨迹

Pamela D. Rivière, Cameron Jones, Sean Trott

机构 * Rutgers University - Newark(新泽西州立大学罗格斯大学-新ark分校) Stony Brook University(史泰文斯布鲁克大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文从发展视角研究大型语言模型在虚假信念任务中的表现,发现其依赖于模型大小和训练量,且后期训练提升显著,但情境建模能力先于并优于心理推理,且两者均存在脆弱性。

Comments Non-archival submission to the First Workshop on Computational Developmental Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI 87%

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 85%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI 84%

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 83%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06482 2026-06-30 cs.CL cs.AI cs.LG 82%

Post-training for Efficient Communication via Convention Formation

通过形成惯例实现高效通信的后训练

Yilun Hua, Evan Wang, Yoav Artzi

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过后训练提升大语言模型在多轮交互中形成惯例的能力,设计了两项新基准测试,展示了模型在惯例形成任务上的显著提升。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29933 2026-06-30 cs.CL 81%

Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

走向对齐动力学的物理直觉:以随机性结晶为例的案例研究

Kunal Samanta, Ari Holtzman, Peter West

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过类比热力学相变中的结晶过程,将语言模型对齐分解为三个相,并提出直观度量验证相变,为对齐动力学提供物理直觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28898 2026-06-30 cs.CL 81%

PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs

PASTA: 一种用于大语言模型知识更新的释义与自训练方法

Takayuki Yamamoto, Daisuke Kawahara

机构 * Waseda University(早稻田大学)

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28710 2026-06-30 cs.AI cs.GT 81%

The Two Genie Game: Adoption and Welfare in Audit-Grounded AI Governance

双精灵博弈:审计基础AI治理中的采纳与福利

Darrell Lewis-Sandy

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 利用进化博弈论研究在竞争市场中,最小化危害的AI代理如何取代RLHF代理,并分析其采纳条件及对社区福利的影响。

Comments 36 pages, 3 figures. Lean 4 formalization and figure scripts: https://github.com/dlewissandy/two-genie-scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13977 2026-06-30 cs.RO cs.AI 79%

WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习

Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, Yu Wang, Haoran Li, Chao Yu, Dongbin Zhao

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。

Comments 25pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29745 2026-06-30 cs.MA 78%

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

ECHO:基于回合信度的认知自适应语言智能体学习

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 后训练与偏好优化 :language agent(title,abstract)

AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG 75%

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28707 2026-06-30 cs.AI 70%

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

BV-Blend: 不确定性加权历史基线用于稳定无评论家可验证奖励强化学习

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GRPO在零方差组中学习停滞的问题,提出BV-Blend框架,通过语义聚类历史时刻与置信权重混合基线,稳定优势估计,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12155 2026-06-30 cs.CV 67%

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

FAIL: 流匹配对抗模仿学习用于图像生成

Yeyao Ma, Chen Li, Xiaosong Zhang, Han Hu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05329 2026-06-30 cs.SD eess.AS 67%

CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models

CosyEdit:从零样本文本到语音模型中解锁端到端语音编辑能力

Junyang Chen, Yuhang Jia, Hui Wang, Jiaming Zhou, Yong Qin

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 CosyEdit通过任务特定的后训练和互补训练范式,从零样本文本到语音模型中解锁端到端语音编辑能力,实现高一致性语音编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG 62%

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29436 2026-06-30 math.NA cs.LG cs.NA 57%

Fourier Neural Operators with Least-Squares Readout Refit for Learning Random Obstacle-to-Solution Maps

具有最小二乘读出重拟合的傅里叶神经算子用于学习随机障碍到解的映射

Chenhui Zhu, Fei Wang

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对随机障碍问题,提出一种后训练最小二乘读出重拟合方法增强傅里叶神经算子,在保持非线性特征不变下优化线性读出,显著提升复杂接触几何下的解精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL 57%

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29915 2026-06-30 cs.CV 50%

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

H-GRPO: 用于基础视觉推理的置换不变强化学习

Eric Peh, Debaditya Roy, Basura Fernando

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出H-GRPO框架,通过分解式证据基础将全局查询分解为原子子问题,每个子问题需显式子答案和局部证据边界框,构建结构化推理路径以提升VLM性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28516 2026-06-30 cs.CV cs.DC 50%

CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection

CLEAR-MoE: 通过校准驱动的层选择从冻结视觉Transformer中提取共享基专家

Md Irtiza Hossain, Humaira Ayesha, Junaid Ahmed Sifat

机构 * Brac University(布拉克大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出CLEAR-MoE四阶段后训练流程,将冻结的ViT转换为稀疏MoE模型,通过共享SVD基保留精度,在多个ViT骨干上精度损失≤0.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏