arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2405.20053 2024-05-31 cs.CL cs.AI cs.LG 88%

Would I Lie To You? Inference Time Alignment of Language Models using Direct Preference Heads

Avelina Asada Hadji-Kyriacou, Ognjen Arandjelovic

专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03715 2024-04-08 cs.LG cs.AI cs.CL 88%

Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences

Corby Rosset, Ching-An Cheng, Arindam Mitra, Michael Santacroce, Ahmed Awadallah, Tengyang Xie

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06754 2024-03-19 cs.CL cs.AI cs.LG 88%

ALaRM: Align Language Models via Hierarchical Rewards Modeling

Yuhang Lai, Siyuan Wang, Shujun Liu, Xuanjing Huang, Zhongyu Wei

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06767 2023-12-04 cs.LG cs.AI cs.CL cs.CV stat.ML 88%

RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Hanze Dong, Wei Xiong, Deepanshu Goyal, Yihan Zhang, Winnie Chow, Rui Pan, Shizhe Diao, Jipeng Zhang, Kashun Shum, Tong Zhang

专题命中 后训练与偏好优化 :foundation model(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 29 pages, 12 figures, Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08786 2025-12-17 cs.CL cs.AI 88%

A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs

对联邦RLHF中偏好聚合的系统评估:为LLM的多元化对齐

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * Department of Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学系 加州大学伊文斯分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract,comments);large language model(abstract);language model(abstract)

AI总结 本文提出了一种自适应偏好聚合方法,通过动态调整权重提升联邦RLHF中LLM的公平性与对齐性能。

Comments This paper is accepted at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11456 2024-05-02 cs.LG cs.AI stat.ML 88%

Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint

Wei Xiong, Hanze Dong, Chenlu Ye, Ziqi Wang, Han Zhong, Heng Ji, Nan Jiang, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments 53 pages; theoretical study and algorithmic design of iterative RLHF and DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15504 2026-08-18 cs.LG stat.ML 新提交 88%

PERO: Efficient Robust Post-Training Foundation Models for Encrypted Traffic Classification

PERO:面向加密流量分类的高效鲁棒预训练后 foundation 模型

Wumei Du, Jiarong Wen, Kaiyu Zhang, Zi Yang, Yiqin Lv, Longfei Zhang, Dong Liang, Zheng Xie

机构 * National University of Defense Technology(国防科技大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对加密流量分类中鲁棒优化成本高的问题,提出PERO框架,通过轻量代理估计风险并选择高风险样本更新模型,在保持性能的同时降低了计算与内存成本。

Comments 16 pages, 6 figures, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22614 2026-08-03 cs.AI 版本更新 88%

DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training

DynaResize:用于分布式语言模型训练后运行时的GPU重新分配

Hanlin Du, Zhiyuan Yan, Yungang Bao, Sa wang

机构 * SKLP, Institute of Computing Technology, CAS(中国科学院计算技术研究所智能处理器研究中心) Bytedance(字节跳动)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 研究基于强化学习的语言模型训练后GPU资源分配问题,提出DynaResize运行时GPU重新分配系统,通过动态切换GPU平衡阶段执行时间,分解操作并去除关键路径非关键工作,实验显示可提高吞吐量、减少执行时间并隐藏部分开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25328 2026-06-25 cs.SD cs.AI 新提交 88%

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音深度伪造检测中鲁棒适应的语音基础模型监督后训练

Zihan Pan, Sailor Hardik, Jinyang Wu

机构 * Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(资讯通信研究院(I2R),新加坡科技研究局(A*STAR))

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 提出混合帧后训练策略,通过帧级监督学习局部不一致性,在ASVspoof5上实现单模型EER 4.50%,在ASVspoof2021上LA与DF的EER差距仅0.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17967 2026-06-25 cs.CL 新提交 88%

Learning task-specific subspaces via interventional post-training of speech foundation models

通过语音基础模型的干预后训练学习任务特定子空间

Jack Cox, Jon Barker

机构 * University of Sheffield(谢菲尔德大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.CL

AI总结 提出一种干预对比学习后训练方法,将语音基础模型的纠缠表示分解为内容和说话人子空间,提升说话人验证和关键词识别性能。

Comments Accepted to Interspeech 2026; 6 pages (4 main body), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21458 2026-06-23 cs.LG 新提交 88%

Post-Training Speech Enhancement Language Models with Perceptual Rewards

基于感知奖励的语音增强语言模型后训练

Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis, Roger Wattenhofer

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 提出使用组序列策略优化(GSPO)结合多指标感知奖励对自回归语音增强语言模型进行后训练,直接优化非可微质量指标,在DNS2020基准上达到最优,且多奖励优化优于单指标变体。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20408 2026-05-21 cs.LG 88%

Spectral Souping: A Unified Framework for Online Preference Alignment

谱汤:一种在线偏好对齐的统一框架

Yinlam Chow, Guy Tennenholtz, Ted Yun, James Harrison, Arthur Gretton, Andre Barreto, Bo Dai

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种统一的在线偏好对齐框架Spectral Souping,通过发现LLM中的通用谱表示,实现了高效的模型合并,从而在不需昂贵在线重训练的情况下快速适应个体用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16842 2026-05-19 cs.AI 88%

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

草图然后绘画:用于扩散多模态大语言模型的分层强化学习

Siqi Luo, Jianghan Shen, Yi Xin, Huayu Zheng, Haoxing Chen, Yan Tai, Yue Li, Junjun He, Yihao Liu, Guangtao Zhai, Yuewen Cao, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG 88%

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11181 2026-05-12 cs.CL 88%

Code Mixologist : A Practitioner's Guide to Building Code-Mixed LLMs

代码调酒师:构建代码混合LLM的从业者指南

Himanshu Gupta, Pratik Jayarao, Chaitanya Dwivedi, Neeraj Varshney

机构 * Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文探讨了代码混合和切换在大语言模型中的挑战,提出统一的分类体系和实用指南,涵盖数据、建模和评估方法,分析现有评估实践并讨论安全问题。

Comments 8 pages main paper, 13 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00986 2026-05-12 cs.CL 88%

Sparse Reward Subsystem in Large Language Models

大语言模型中的稀疏奖励子系统

Guowei Xu, Mert Yuksekgonul, James Zou

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究揭示大语言模型隐藏状态中稀疏神经元构成奖励子系统,识别价值神经元和多巴胺神经元,用于预测模型置信度和指导推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI 88%

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13833 2026-04-17 cs.CL 88%

Robust Reward Modeling for Large Language Models via Causal Decomposition

通过因果分解实现大型语言模型的鲁棒奖励建模

Yunsheng Lu, Zijiang Yang, Licheng Pan, Zhixuan Chu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Statistics, University of Chicago(芝加哥大学统计系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过因果分解学习解码器,以增强奖励模型对提示意图的建模,从而提升在数学、帮助性和安全性的基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18806 2026-04-14 cs.AI 88%

dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models

dTRPO:扩散大语言模型策略优化中的轨迹缩减

Wenxuan Zhang, Lemeng Wu, Changsheng Zhao, Ernie Chang, Mingchen Zhuge, Zechun Liu, Andy Su, Hanxian Huang, Jun Chen, Chong Zhou, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Wei Wen

机构 * Meta AI

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出dTRPO,通过减少轨迹概率计算成本提升扩散大语言模型的策略优化效果,实验显示在STEM、编程和指令遵循任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01597 2026-04-03 cs.LG 88%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);SFT(abstract);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20795 2026-03-23 cs.CL 88%

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

通过文本模型预测控制对大型语言模型进行测试时对齐

Kuang-Da Wang, Teng-Ruei Chen, Yu Heng Hung, Guo-Xun Ko, Shuoyang Ding, Yueh-Hua Wu, Yu-Chiang Frank Wang, Chao-Han Huck Yang, Wen-Chih Peng, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University NVIDIA National Taiwan University

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。

Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00152 2026-03-06 cs.CV cs.AI 88%

Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

Dr. Seg: 通过感知导向设计重新审视GRPO训练用于视觉大语言模型

Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Dr.Seg通过感知导向设计重新审视GRPO训练,提出简单框架提升视觉任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10986 2026-02-12 cs.LG 88%

TVCACHE: A Stateful Tool-Value Cache for Post-Training LLM Agents

TVCACHE: 一种具有状态的工具-价值缓存用于训练后LLM代理

Abhishek Vijaya Kumar, Bhaskar Kataria, Byungsoo Oh, Emaad Manzoor, Rachee Singh

机构 * cornell(康奈尔大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 TVCACHE通过维护工具调用序列树和最长前缀匹配,实现LLM代理训练后的高效缓存,提高缓存命中率并减少工具调用时间。

Comments Abhishek Vijaya Kumar and Bhaskar Kataria have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17918 2026-01-27 cs.CV cs.CL 88%

Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models

医疗大视觉-语言模型的直接偏好优化基准测试

Dain Kim, Jiwoo Lee, Jaehoon Yun, Yong Hoe Koo, Qingyu Chen, Hyunjae Kim, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰林大学医学院) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医院) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);分类 cs.CL

AI总结 本文评估了医疗领域中多种DPO变体,发现其在视觉问答任务中存在性能不一致和视觉误解问题,并提出针对性策略提升3.6%。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10532 2026-01-19 cs.CL 88%

PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models

PERM:基于心理学的共情奖励建模用于大语言模型

Chengbing Wang, Wuqiang Zheng, Yang Zhang, Fengbin Zhu, Junyi Cheng, Yi Xie, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PERM通过双向分解和旁观者视角提升大语言模型的共情能力,实验显示其在同理心基准和对话数据集上表现优异,用户偏好率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 88%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 88%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11711 2025-12-19 cs.LG 88%

Reinforcement Learning Finetunes Small Subnetworks in Large Language Models

强化学习在大型语言模型中微调小型子网络

Sagnik Mukherjee, Lifan Yuan, Dilek Hakkani-Tur, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 强化学习在大型语言模型中通过微调小型子网络显著提升性能,且该子网络更新稀疏性源于数据分布和正则化技术的影响。

Comments NeuRIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03882 2025-12-04 cs.LG 88%

Automatic Attack Discovery for Few-Shot Class-Incremental Learning via Large Language Models

通过大语言模型实现少样本类增量学习的自动攻击发现

Haidong Kang, Wei Wu, Hanling Wang

机构 * School of Computer and Communication Engineering(计算机与通信工程学院) School of Information and Communication(信息与通信学院) University of Electronic Science and Technology of China(电子科学与技术大学) Department of Strategic and Advanced Interdisciplinary Research(战略与先进跨学科研究部) Pengcheng Laboratory(鹏城实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出ACraft方法,利用大语言模型自动发现针对少样本类增量学习的最优攻击方法,有效提升攻击性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02807 2025-12-03 cs.CL 88%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏