arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2310.01045 2024-02-13 cs.CL 77%

Tool-Augmented Reward Modeling

Lei Li, Yekun Chai, Shuohuan Wang, Yu Sun, Hao Tian, Ningyu Zhang, Hua Wu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00168 2024-02-05 cs.LG 77%

The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback

Nathan Lambert, Roberto Calandra

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00243 2024-01-02 cs.LG 77%

Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles

Yuanzhao Zhai, Han Zhang, Yu Lei, Yue Yu, Kele Xu, Dawei Feng, Bo Ding, Huaimin Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16609 2023-09-29 cs.CL 77%

Qwen Technical Report

Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, Binyuan Hui, Luo Ji, Mei Li, Junyang Lin, Runji Lin, Dayiheng Liu, Gao Liu, Chengqiang Lu, Keming Lu, Jianxin Ma, Rui Men, Xingzhang Ren, Xuancheng Ren, Chuanqi Tan, Sinan Tan, Jianhong Tu, Peng Wang, Shijie Wang, Wei Wang, Shengguang Wu, Benfeng Xu, Jin Xu, An Yang, Hao Yang, Jian Yang, Shusheng Yang, Yang Yao, Bowen Yu, Hongyi Yuan, Zheng Yuan, Jianwei Zhang, Xingxuan Zhang, Yichang Zhang, Zhenru Zhang, Chang Zhou, Jingren Zhou, Xiaohuan Zhou, Tianhang Zhu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

Comments 59 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13094 2023-09-26 cs.GL cs.AI 77%

Computational Natural Philosophy: A Thread from Presocratics through Turing to ChatGPT

Gordana Dodig-Crnkovic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05585 2023-08-11 cs.AI 77%

Proximal Policy Optimization Actual Combat: Manipulating Output Tokenizer Length

Miao Fan, Chen Hu, Shuchang Zhou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15507 2025-07-22 cs.LG cs.AI cs.CL 76%

Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback

Johannes Ackermann, Takashi Ishida, Masashi Sugiyama

专题命中 后训练与偏好优化 :language model(abstract,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accept at the Conference On Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06408 2025-05-27 cs.CE 76%

A New DAPO Algorithm for Stock Trading

Ruijian Zha, Bojun Liu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(comments)

Comments Accepted to IEEE IDS 2025 Special Track: Financial Reinforcement Learning and Foundation Models (FinRLFM). 3 pages, 2 figures, 3 tables

Journal ref Proc. of the 2025 IEEE 11th International Conference on Intelligent Data and Security (IDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13088 2024-08-06 cs.CL cs.AI cs.CY cs.LG 76%

Should We Attend More or Less? Modulating Attention for Fairness

Abdelrahman Zayed, Goncalo Mordido, Samira Shabanian, Sarath Chandar

专题命中 后训练与偏好优化 :language model(abstract,comments);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Proceedings of Conference on Language Modeling (COLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 76%

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL、cs.AI

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16240 2026-07-21 cs.LG cs.AI 新提交 76%

Normalized Rewards for Preference Optimization

偏好优化的归一化奖励

Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI、cs.LG

AI总结 研究针对直接对齐算法过度优化隐式奖励模型的问题,提出添加正则化项的方法,通过研究似然变化分布理解过度优化,应用该正则化于相关方法,实现生成质量与基准能力权衡及奖励建模改进,提升了模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24994 2026-06-25 cs.LG cs.AI 新提交 76%

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

ExTra: 面向语言模型强化学习的探索性轨迹优化

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP

专题命中 后训练与偏好优化 :language model(title);分类 cs.AI、cs.LG

AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21498 2026-06-23 cs.AI cs.LG 新提交 76%

Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

平衡GRPO自回归文本到图像后训练中的性能与多样性

Yuanhao Chiang, Hongbo Duan, Chunru Yang, Jiahua Pei, Yi Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV 76%

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12483 2026-05-21 cs.LG cs.AI 76%

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

超越GRPO和在线策略蒸馏:一种经验性稀疏到密集奖励原则用于语言模型后训练

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种经验性的稀疏到密集奖励原则,用于语言模型后训练,通过在教师模型上使用稀疏奖励进行探索和发现,然后通过密集监督将行为压缩到部署模型中,从而在数学问题上实现了优于GRPO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG 76%

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.LG

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12380 2026-05-13 cs.LG cs.AI 76%

Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training

信任批量,策略上或下策略:训练后强化学习的自适应策略优化

Rasool Fakoor, Murdock Aubry, Nicholas Stranges, Alexander J. Smola

机构 * Boson AI

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 本文提出一种自适应策略优化方法,通过动态调整策略更新的信任区域和下策略正则化强度,以提高强化学习在训练后对数据分布变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22873 2026-04-28 cs.LG cs.AI 76%

When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

当政策无法再训练时:一种统一的闭式视图的离线强化学习后训练引导

Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay, Ozlem Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science(工程与计算机科学学院)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 研究探讨了在离线强化学习中,冻结的演员在部署时通过专家产品组合与目标条件先验进行适应,发现精度加权组合在退化或随机先验下仍能保持冻结演员的稳定性,而其他方法失效。同时揭示了在冻结演员设置下,PoE与KL正则化适应的闭式恒等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04851 2026-03-06 cs.LG cs.CL 76%

Why Is RLHF Alignment Shallow? A Gradient Analysis

为什么RLHF对齐是浅层的?一种梯度分析

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 后训练与偏好优化 :RLHF(title);分类 cs.CL、cs.LG

AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00195 2025-12-04 cs.CL cs.AI cs.HC 76%

Let Them Down Easy! Contextual Effects of LLM Guardrails on User Perceptions and Preferences

让它们轻松一些!LLM护栏对用户感知和偏好的情境影响

Mingqian Zheng, Wenjia Hu, Patrick Zhao, Motahhare Eslami, Jena D. Hwang, Faeze Brahman, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Simon Fraser University(西蒙弗雷泽大学) Allen Institute for AI(人工智能研究所)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM护栏对用户感知和偏好的影响,发现部分合规策略能显著降低负面感知,强调应通过创造性的拒绝策略而非意图检测来提升安全性和用户体验。

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19479 2025-10-23 cs.LG cs.AI 76%

Graph Unlearning Meets Influence-aware Negative Preference Optimization

Qiang Chen, Zhongze Wu, Ang He, Xi Lin, Shuo Jiang, Shan You, Chang Xu, Yi Chen, Xiu Su

机构 * Central South University(中南大学) Shanghai Maritime University(上海 Maritime 大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) SenseTime Research(商汤科技研究院) University of Sydney(悉尼大学) Hong Kong University of Science(香港科学大学)

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22296 2025-10-09 cs.CL cs.LG 76%

360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training

Haosheng Zou, Xiaowei Lv, Shousheng Jia, Lin Li, Xiaochun Gong, Xiangzheng Zhang

机构 * Qiyuan Tech(启元科技) Renmin University(中国人民大学)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.LG

Comments v2: sp for vlms; code at https://github.com/Qihoo360/360-LLaMA-Factory

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04663 2024-08-12 cs.CL cs.AI 76%

Dopamin: Transformer-based Comment Classifiers through Domain Post-Training and Multi-level Layer Aggregation

Nam Le Hai, Nghi D. Q. Bui

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI

Comments Accepted at The 3rd Intl. Workshop on NL-based Software Engineering, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19595 2026-08-21 cs.IR 新提交 75%

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

SSR-GRPO:将监督与语义标识符集成到强化学习中用于电商领域的密集检索

Guangxin Song, Xing Fang, Mingmin Jin, Jing Wang, Bokang Wang, Zhentao Song, Junjie Bai, Jianbo Zhu

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对电商嵌入检索的语义处理难题,提出SSR-GRPO模型,通过双视角相关性评估、难负样本挖掘等策略优化R-GRPO,经实验验证有效并已部署于大规模电商平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18881 2026-08-20 cs.CV 新提交 75%

Falcon Perception-HD: High Density Perception via Reinforcement Learning

Falcon Perception-HD:基于强化学习的高密度感知

Sofian Chaybouti, Yasser Dahou, Ngoc Dung Huynh, Reda Alami, Hilde Kuehne

机构 * Tübingen AI Center(蒂宾根人工智能中心) University of Tübingen(蒂宾根大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) Technology Innovation Institute(技术创新研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 该研究针对开放词汇自回归感知模型的目标错位问题,基于Falcon Perception设计RL框架,采用GRPO优化,在指代表达分割任务上提升了极密集场景性能,减少冗余需求并保留物体存在性知识。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21834 2026-08-17 cs.MA 版本更新 75%

RobustFlow: Towards Robust Agentic Workflow Generation

RobustFlow:面向鲁棒智能体工作流生成

Shengxiang Xu, Jiayi Zhang, Shimin Di, Yuyu Luo, Liang Yao, Hanmo Liu, Jia Zhu, Min-Ling Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对现有智能体工作流生成方法对语义等价不同表述指令鲁棒性不足的问题,提出RobustFlow系统,结合偏好优化与专用基准,在多扰动下鲁棒性得分70%--90%,优于AFlow、ScoreFlow等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交 75%

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract)

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11787 2026-08-13 cs.CL cs.AI cs.LG 新提交 75%

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型

Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

机构 * Intuit(英图易(金融科技公司))

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03895 2026-08-07 cs.LG cs.AI cs.CL 版本更新 75%

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练

Chi Liu, Xin Chen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏