arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 17 篇

2604.07941 2026-04-17 cs.CL cs.AI cs.LG 94%

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

大语言模型后训练:一种统一的偏置学习与在线学习视角

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia, Yanzhe Zhang, Hualong Yu, Zichen Xu, Qicheng Li, Yong Qin

机构 * Nankai University(南开大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文探讨了大语言模型后训练的统一框架,通过轨迹溯源划分偏置学习与在线学习两种模式,分析了支持扩展、策略重塑和行为固化等核心方法,强调系统设计协调性对进展的重要性。

Comments 38 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL 92%

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02585 2026-04-17 cs.AI cs.CL 92%

Mitigating LLM biases toward spurious social contexts using direct preference optimization

通过直接偏好优化减轻LLM对虚假社会情境的偏见

Hyunji Nam, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM对虚假社会情境的鲁棒性,提出Debiasing-DPO方法,通过自监督训练和监督微调减少偏见并提升预测准确性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV 91%

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 91%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);preference optimization(abstract)

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07449 2026-04-17 cs.IR cs.AI 89%

RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking

RLPO:长上下文评论排序的残差列表偏好优化

Hao Jiang, Zhi Yang, Annan Wang, Yichi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLPO,通过残差列表级优化提升长上下文评论排序,解决传统方法在长上下文下的效率与准确性矛盾,实验显示其在NDCG@k上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13833 2026-04-17 cs.CL 88%

Robust Reward Modeling for Large Language Models via Causal Decomposition

通过因果分解实现大型语言模型的鲁棒奖励建模

Yunsheng Lu, Zijiang Yang, Licheng Pan, Zhixuan Chu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Statistics, University of Chicago(芝加哥大学统计系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过因果分解学习解码器,以增强奖励模型对提示意图的建模,从而提升在数学、帮助性和安全性的基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09457 2026-04-17 cs.CL cs.LG 87%

Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms

朝着弥合直接对齐算法中的奖励生成差距而努力

Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14932 2026-04-17 cs.AI 83%

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

WavAlign:通过自适应混合后训练增强口语对话模型的智能与表达性

Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang, Jingyu Lu, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义实验室,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出WavAlign方法,通过自适应混合后训练提升口语对话模型的智能与表达性,通过语义通道约束和显式锚定改进语音生成,避免不可靠的偏好梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00361 2026-04-17 cs.LG 79%

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13175 2026-04-17 cs.LG cs.AI q-bio.BM q-bio.QM 79%

Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization

通过平滑切比雪夫标量化实现帕累托最优的离线强化学习

Aadyot Bhatnagar, Peter Mørch Groth, Ali Madani

机构 * Profluent Bio, Inc.(Profluent生物公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STOMP算法,通过平滑切比雪夫标量化方法解决多目标强化学习中的非凸帕累托前沿问题,验证了其在蛋白质工程任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14237 2026-04-17 cs.LG 77%

TOPCELL: Topology Optimization of Standard Cell via LLMs

TOPCELL: 通过LLMs进行标准单元的拓扑优化

Zhan Song, Yu-Tung Liu, Chen Chen, Guoheng Sun, Jiaqi Yin, Chia-tung Ho, Ang Li, Haoxing Ren, Cunxi Yu

机构 * University of Maryland(马里兰大学) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出TOPCELL框架,利用LLMs将高维拓扑探索转化为生成任务,通过GRPO优化实现逻辑和空间约束下的高效拓扑优化,实验显示其在2nm节点中性能优于基础模型,且在7nm库生成中实现85.91倍速度提升。

Comments Accepted to the 63rd ACM/IEEE Design Automation Conference (DAC 2026). 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14895 2026-04-17 cs.LG cs.AI 73%

Beyond Importance Sampling: Rejection-Gated Policy Optimization

超越重要性采样:拒绝门策略优化

Ziwu Sun, Zhen Gao, Jiyong Zhang, Jiaheng Li

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出拒绝门策略优化方法,通过引入可微的接受门替代重要性采样比,统一了TRPO、PPO和REINFORCE的策略梯度,并证明其在重要性采样比重尾时能保证有限梯度方差。

Comments 27 pages, includes theoretical analysis and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15311 2026-04-17 cs.CV 71%

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng

机构 * The Australian National University(澳大利亚国立大学)

专题命中 后训练与偏好优化 :post-training(title)

AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。

Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14920 2026-04-17 cs.AI 57%

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究

Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 57%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26109 2026-04-17 cs.LG 57%

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

不要踏进同一条河两次:从试错中学习推理

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department, Tencent(腾讯LLM部门)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出LTE方法,通过提示模型自身之前的错误来提升推理能力,优于传统方法并在多个数学推理基准上表现更佳。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏