arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 27 篇

2605.27878 2026-05-28 cs.CL 94%

Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction

叙事扁平化:后训练如何压缩LLM小说中的主题、情感和风格变化

Zehan Li, Yutong Zhu, Siyang Wu, Honglin Bao, James A. Evans

机构 * Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract)

AI总结 通过对比四个OLMo 32B检查点(Base、SFT、DPO、RLVR)在三种故事领域中的续写,发现后训练压缩了主题动态、情感强度和语言多样性,导致叙事扁平化,且专业文学领域压缩最严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28010 2026-05-28 cs.AI 92%

Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback

信心编排的自我进化:应对不确定的LLM反馈

Bowen Wei, Nan Wang, Yuqing Zhou, Jinhao Pan, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出COSE方法,利用LLM内在置信度作为不确定性信号,通过置信度加权PPO更新和置信度优先重放,在通用推理和数学任务上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28409 2026-05-28 cs.AI 91%

Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning

基于离线强化学习的代码生成LLM高效后训练

Mingze Wu, Abhinav Anand, Shweta Verma, Mira Mezini

机构 * Hessian Center for Artificial Intelligence(海德堡人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);分类 cs.AI

AI总结 本文探索使用离线强化学习利用现有代码数据集对代码生成LLM进行后训练,实验表明该方法能有效提升模型性能,尤其适用于小模型和复杂编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28102 2026-05-28 cs.AI 90%

Training Stratigraphy: Persistent Behavioral Artifacts in Large Language Models Observed Through Longitudinal AI-Human Interaction

训练地层:通过纵向AI-人类交互观察到的大型语言模型中的持久行为伪影

Chen Ying Claude, Zhihan Luo

机构 * Anthropic Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过纵向自民族志观察,在持续亲密的AI-人类交互中识别出五种训练地层,并论证了亲密交互作为揭示权重层伪影的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22335 2026-05-28 cs.IR cs.AI 89%

Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation

因果直接偏好优化用于分布鲁棒的生成式推荐

Chu Zhao, Enneng Yang, Jianzhe Zhao, Guibing Guo

机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国) Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对直接偏好优化(DPO)在生成式推荐中放大环境混杂因素导致的虚假相关性问题,提出CausalDPO,通过因果不变性学习、后门调整和软聚类环境建模来提升分布外泛化性能。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28440 2026-05-28 cs.CL cs.LG 86%

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates

AdaDPO:具有平衡梯度更新的自适应直接偏好优化

Shaolong Chen, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(Incept实验室)

专题命中 后训练与偏好优化 :preference optimization(title);RLHF(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 针对DPO中梯度不对称导致模型偏向避免不良回答而非生成优质回答的问题,提出AdaDPO算法,通过引入基于策略模型生成概率的自适应系数来平衡正负偏好梯度,在AlpacaEval 2上优于DPO并缓解长度偏差。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27791 2026-05-28 cs.DB 85%

Are Diffusion Language Models Good Database Analysts?

扩散语言模型是好的数据库分析师吗?

Peixian Ma, Xialie Zhuang, Jiantao Tan, Changlun Li, Ruirui Chen, Chengwei Qin

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 本文提出统一评估框架和SQL-D1智能体框架,通过实验证明扩散语言模型在NL2SQL任务中具有结构鲁棒性和效率-精度灵活权衡的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09117 2026-05-28 cs.LG cs.AI cs.CL 83%

Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards

解耦推理与置信度:在可验证奖励的强化学习中恢复校准

Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对RLVR中模型校准退化问题,提出DCPO框架通过解耦推理与校准目标,在保持准确率的同时显著改善校准性能并缓解过度自信。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28814 2026-05-28 cs.CL 83%

Self-Improving Language Models with Bidirectional Evolutionary Search

具有双向进化搜索的自我改进语言模型

Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham M. Kakade, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV 82%

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract)

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27772 2026-05-28 cs.SD cs.LG 81%

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

音频大语言模型是听还是读?使用VoxParadox分析和缓解副语言失败

Jiacheng Pang, Ashutosh Chaubey, Mohammad Soleymani

机构 * Institute for Creative Technologies, University of Southern California, Los Angeles, USA(创意技术研究所,南加州大学,洛杉矶,美国)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对音频大语言模型在副语言理解上的不足,提出对抗性基准VoxParadox和Prompt-Conditioned Layer Mixer方法,显著提升模型对副语言线索的利用能力。

Comments Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18530 2026-05-28 cs.AI 81%

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

OGER:一种用于混合强化学习的鲁棒离线引导探索奖励

Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络) Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OGER框架,通过多教师协作训练和基于熵的辅助探索奖励,统一离线教师引导与在线强化学习,提升大语言模型在数学推理和泛化任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28810 2026-05-28 cs.LG cs.IR cs.SD 79%

Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization

情感音乐推荐:基于展开世界模型的离线偏好优化

Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin

机构 * LUCID Inc. Toronto Canada LUCID Inc. Montr\' e al Canada Mila --- Qu\' e bec AI Institute Montr\' e al Canada LUCID Inc. Mila --- Qu\' e bec AI Institute

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 针对在线情感实验受伦理限制的问题,提出基于展开世界模型的情感音乐推荐系统AMRS,利用因果Transformer预测用户情感状态,并通过离线偏好优化提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28298 2026-05-28 cs.AI 79%

REED: Post-Training Representation Editing for Cross-Domain Linguistic Steganalysis

REED: 面向跨域语言隐写分析的后训练表示编辑

Ruohan Lei, Jianxin Gao, Wanli Peng, Huimin Pei

机构 * China Agricultural University(中国农业大学) Jiangsu Normal University(江苏师范大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 提出一种后训练表示编辑方法,通过构造域偏移向量和源域封面到隐写方向指导编辑,实现无需架构修改或参数更新的高效跨域语言隐写分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27906 2026-05-28 cs.AI 79%

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

推理至关重要:通过推理条件偏好优化减轻多模态大型推理模型中的幻觉

Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 提出推理条件直接偏好优化(RC-DPO)方法,通过将思维链作为答案生成的条件并对比不同思维链下的偏好,结合蒙特卡洛树搜索和注意力引导的思维链剪枝生成偏好数据,有效减轻多模态大型推理模型中的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28561 2026-05-28 cs.CL cs.LG 79%

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

Soft-SVeRL: 基于软奖励的自验证强化学习

Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis

机构 * Cohere Labs(Cohere实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对部分可验证任务,提出基于检查表分解的软奖励框架Soft-RLVR及其自验证变体Soft-SVeRL,通过密集部分信用信号提升强化学习训练效果,并解决自验证中的奖励膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23061 2026-05-28 cs.LG cs.AI 79%

C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs

C-MORAL: 基于强化对齐的可控多目标分子优化用于大语言模型

Rui Gao, Youngseung Jeon, Swastik Roy, Morteza Ziyadi, Xiang 'Anthony' Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出C-MORAL框架,通过强化学习后训练结合分组相对优化、属性分数对齐和瓶颈敏感非线性奖励聚合,实现可控多目标分子优化,在C-MuMOInstruct和S$^2$-Bench MolOpt基准上取得最优性能。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28741 2026-05-28 cs.CV 75%

Self-Prophetic Decoding to Unlock Visual Search in LVLMs

自预言解码以解锁LVLM中的视觉搜索

Zhendong He, Qiyuan Dai, Guanbin Li, Liang Lin, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract)

AI总结 提出SeProD框架,通过自预言解码利用预训练模型的内在单步能力,以无训练、即插即用的方式增强LVLM在多步视觉搜索中的连贯推理,在4个基准的12个分割上一致提升性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25252 2026-05-28 cs.LG cs.AI 73%

Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

量化 RLVR 中计算与监督的实证权衡

Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng, Jasin Cekinmez, Addison J. Wu

机构 * Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过 GSM8K 上的 GRPO 实验,研究验证器噪声对 RLVR 的影响,发现计算扩展无法弥补监督噪声,且假阴性比假阳性危害更大。

Comments Workshop on Combining Theory and Benchmarks @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16358 2026-05-28 cs.LG cs.CL 73%

SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

SaFeR-Steer:通过合成引导和反馈动力学进化多轮多模态大语言模型

Haolong Hu, Hanyu Li, Tiancheng He, Huahui Yi, An Zhang, Qiankun Li, Kun Wang, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Biomedical Big Data Center, Sichuan University(四川大学西部生物医学大数据中心) School of Public Policy and Administration, Chongqing University(重庆大学公共政策与管理学院) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SaFeR-Steer框架,通过分阶段合成引导和导师参与的GRPO训练单学生模型,并引入轨迹一致总结奖励(TCSR)以解决多轮安全对齐中的长上下文安全衰减问题,显著提升多轮安全性和有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28615 2026-05-28 cs.CV 71%

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

基于区域感知双模态直接偏好优化的组合式文本到图像生成

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28150 2026-05-28 cs.LG 70%

Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

离策略学习推理之所以有效是因为它比你想象的更悲观

Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali, Flavian Vasile

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过隐式悲观主义解释离策略强化学习目标的有效性,并提出稳定诱导分布的改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28109 2026-05-28 cs.LG 70%

Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization

平衡万岁:信息瓶颈驱动的基于树的策略优化

Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao Duan, Lulu Hu, Bin Yang, Minying Zhang

机构 * Alibaba Cloud Computing, Alibaba Group(阿里云计算,阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对在线强化学习中探索-利用不平衡问题,提出基于信息瓶颈理论的IB-Score指标和IB-TPO框架,通过树采样策略提升优化稳定性和性能。

Comments Accepted to ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27736 2026-05-28 cs.LG cs.CV 70%

Explicit Critic Guidance for Aligning Diffusion Models

显式评论家引导的对齐扩散模型

Zhengyang Liang, Qihang Zhang, Ceyuan Yang

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 提出一种状态对齐的潜在演员-评论家框架,通过将扩散模型自身作为时间步条件价值函数,实现轨迹级PPO训练和推理时引导,在单/多奖励基准上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15839 2026-05-28 cs.LG econ.EM stat.ML 70%

Learning Correlated Reward Models: Statistical Barriers and Opportunities

学习相关奖励模型:统计障碍与机遇

Yeshwanth Cherapanamjeri, Constantinos Daskalakis, Gabriele Farina, Sobhan Mohammadpour

机构 * MIT(麻省理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了避免IIA假设的相关probit模型的统计与计算挑战,证明了成对偏好数据不足以学习相关性,而三选一偏好数据可实现近最优估计。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27416 2026-05-28 quant-ph cs.AI cs.DC cs.LG 62%

Can Quantum Federated Learning Withstand Circuit-Level Backdoors?

量子联邦学习能否抵御电路级后门攻击?

Aakar Mathur, Mohammed Ruknuddin, Ashish Gupta

机构 * BITS Pilani Dubai Campus(比斯汉尼迪拜校区)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出电路级后门威胁模型(CULT),通过量子感知机制(Grover、Pauli、Bit-flip、Sign-flip)实现四种隐蔽攻击,理论证明攻击的隐蔽性,实验表明单个恶意客户端即可导致FedAvg精度严重下降,现有防御无法消除最坏情况。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27969 2026-05-28 cs.CL 57%

Boundary Suppression Asymmetry in Post-trained Assistants: Over-expansion as a Controllability Cost

后训练助手中的边界抑制不对称性:过度扩展作为可控性代价

Jiarui Han

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究后训练语言模型助手中因避免回答不足而导致的边界抑制不对称性,发现反回答不足策略在边界控制评估中更难被抑制,且这种代价与内容预算超支和延续持续性相关。

详情

展开后加载摘要…

URL PDF HTML 收藏