arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2603.15647 2026-03-18 cs.LG cs.AI 82%

Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing

引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐

Zeyu Zhang, Xiangxiang Dai, Ziyi Han, Xutong Liu, John C. S. Lui

机构 * The Chinese University of Hong Kong(香港中文大学) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17721 2026-03-09 cs.LG cs.AI cs.MA 82%

Aligning Compound AI Systems via System-level DPO

通过系统级DPO对复合AI系统进行对齐

Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Mila Quebec AI Institute(魁北克AI研究院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);foundation model(abstract);preference optimization(abstract)

AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04968 2026-03-06 cs.CL cs.AI 82%

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

当弱大语言模型自信发言时,偏好对齐会变得更强大

Amirabbas Afzali, Myeongho Jeon, Maria Brbic

机构 * EPFL(苏黎世联邦理工学院) Sharif University of Technology(谢赫·穆吉加布大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。

Comments 32 pages, 8 figures, International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03112 2026-03-05 cs.CL cs.AI cs.CY 82%

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

RLVER: 通过可验证情绪奖励的强化学习实现共情代理

Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen, Zhiwei He, Kang Luo, Qingsong Lv, Qingxuan Jiang, Zheng Xie, Shanyi Wang, Yuan Li, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 RLVER通过可验证情绪奖励提升LLM的共情能力,实验显示其在对话任务中显著提升表现,尤其在情感理解和洞察力方面成效显著。

Comments Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15222 2026-02-18 cs.LG cs.AI 82%

Automatically Finding Reward Model Biases

自动发现奖励模型偏差

Atticus Wang, Iván Arcuschin, Arthur Conmy

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种利用LLM自动发现奖励模型偏差的方法,揭示了已知和新型偏差,并展示了进化迭代优于传统搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 82%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06665 2026-02-09 cs.CL cs.AI 82%

Not All Layers Need Tuning: Selective Layer Restoration Recovers Diversity

并非所有层都需要调节:选择性层恢复恢复多样性

Bowen Zhang, Meiyi Wang, Harold Soh

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Smart Systems Institute, National University of Singapore, Singapore, Singapore(新加坡国立大学智能系统研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 选择性层恢复通过恢复特定层到预训练权重,提升LLM输出多样性并保持高质量。

Comments 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-02-06 cs.LG cs.AI 82%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments 10 pages for main text, 10 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20106 2026-02-05 cs.LG cs.AI 82%

Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

基于偏好向量的自适应有益有害对齐

Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu, Saransh Agrawal, Shih-Cheng Huang, Chieh-Yen Lin, Shang-Tse Chen, Kuan-Hao Huang, Shao-Hua Sun

机构 * National Taiwan University(国立台湾大学) Texas A&M University(德克萨斯A&M大学) Appier AI Research(Appier人工智能研究院) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出偏好向量框架,通过模块化方法实现细粒度的用户可控偏好调整,提升大语言模型的有益性和无害性平衡。

Comments Accepted at The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00665 2026-02-02 cs.CL cs.AI 82%

SAFER: Probing Safety in Reward Models with Sparse Autoencoder

SAFER: 通过稀疏自动编码器探索奖励模型的安全性

Wei Shi, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22718 2026-02-02 cs.AI cs.LG 82%

A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization

后退一步:前缀重要性比率稳定了策略优化

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17579 2025-11-25 cs.LG cs.AI 82%

Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation

通过价值去相关与外推实现大语言模型的多值对齐

Hefei Xu, Le Wu, Chen Cheng, Hao Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。

Comments accepted by AAAI26 oral; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07896 2025-11-12 cs.AI cs.CL 82%

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

Dengcan Liu, Jiahao Li, Zheren Fu, Yi Tu, Jiajun Li, Zhendong Mao, Yongdong Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 15pages,11figures,AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18312 2025-11-10 cs.LG cs.AI 82%

What Matters in Data for DPO?

Yu Pan, Zhongze Cai, Guanting Chen, Huaiyang Zhong, Chonghuan Wang

机构 * University of Sydney(悉尼大学) Imperial College London(伦敦帝国理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07426 2025-10-28 cs.LG cs.AI 82%

RePO: Understanding Preference Learning Through ReLU-Based Optimization

Junkang Wu, Kexin Huang, Xue Wang, Jinyang Gao, Bolin Ding, Jiancan Wu, Xiangnan He, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心) MoE Key Lab of BIPC, University of Science and Technology of China(BIPC联合实验室,中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18849 2025-10-22 cs.CL cs.AI 82%

Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning

Chenghao Zhu, Meiling Tao, Tiannan Wang, Dongyi Ding, Yuchen Eleanor Jiang, Wangchunshu Zhou

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Electronic Science and Technology of China(电子科技大学) South China Agricultural University(华南农业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17225 2025-10-07 cs.CL cs.AI 82%

SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation

Xiaqiang Tang, Yi Wang, Keyu Hu, Rui Xu, Chuang Li, Weigao Sun, Jian Li, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Chinese Academy of Sciences(中国科学院) Shanghai AI Lab(上海人工智能实验室) Tencent Hunyuan(腾讯文英)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03206 2025-10-03 cs.CL cs.AI 82%

Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward

Yanming Wan, Jiaxing Wu, Marwa Abdulhai, Lior Shani, Natasha Jaques

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学) Google Research(谷歌研究) University of California, Berkeley(伯克利加州大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07780 2025-09-29 cs.LG cs.CL 82%

A Critical Look At Tokenwise Reward-Guided Text Generation

Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Western University(西方大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Work accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19775 2025-09-25 cs.CL cs.AI cs.CR 82%

bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs

Wence Ji, Jiancan Wu, Aiying Li, Shuyi Zhang, Junkang Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24846 2025-09-24 cs.AI cs.CL 82%

MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

Jingyan Shen, Jiarui Yao, Rui Yang, Yifan Sun, Feng Luo, Rui Pan, Tong Zhang, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学) Rice University(稻谷大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17407 2025-09-23 cs.AI cs.CL 82%

Post-hoc Reward Calibration: A Case Study on Length Bias

Zeyu Huang, Zihan Qiu, Zili Wang, Edoardo M. Ponti, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) Alibaba Group(阿里巴巴集团) INF Technology(INF技术) University of Amsterdam(阿姆斯特丹大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05129 2025-09-19 cs.CL cs.CY cs.LG 82%

SMART: Simulated Students Aligned with Item Response Theory for Question Difficulty Prediction

Alexander Scarlatos, Nigel Fernandez, Christopher Ormerod, Susan Lottridge, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Cambium Assessment(Cambium评估)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Published in EMNLP 2025: The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13081 2025-09-17 cs.CL cs.AI 82%

Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO

Francesco Pappone, Ruggero Marino Lazzaroni, Federico Califano, Niccolò Gentile, Roberto Marras

机构 * AI Sparks(AI火花) University of Graz(格拉茨大学) Foyer Group(Foyer集团) Onepix Academy(Onepix学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06645 2025-07-29 cs.CL cs.AI 82%

FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings

Tong Liu, Xiao Yu, Wenxuan Zhou, Jindong Gu, Volker Tresp

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18699 2025-07-23 cs.CL cs.LG stat.ME 82%

MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment

Tianze Wang, Dongnan Gui, Yifan Hu, Shuhang Lin, Linjun Zhang

机构 * Department of Statistics, Rutgers University, New Brunswick, United States Department of Computer Science, Rutgers University, New Brunswick, United States College of Management of Technology, EPFL, Switzerland Department of Computer Science, ETH Zurich, Switzerland

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06902 2025-07-04 eess.SP cs.AI cs.HC cs.LG 82%

Learning From Crowdsourced Noisy Labels: A Signal Processing Perspective

Shahana Ibrahim, Panagiotis A. Traganitis, Xiao Fu, Georgios B. Giannakis

机构 * Department of Electrical and Computer Engineering, University of Central Florida(中央佛罗里达大学电气与计算机工程系) School of Electrical Engineering and Computer Science, Oregon State University(俄勒冈州立大学电气工程与计算机科学学院) Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17618 2025-06-24 cs.LG cs.AI 82%

Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales

Ju-Seung Byun, Andrew Perrault

机构 * Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Computer Science(计算机科学系) Engineering, The Ohio State University(工程系,俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16502 2025-06-23 cs.CL cs.AI 82%

Relic: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examples

Soumya Suvra Ghosal, Vaibhav Singh, Akash Ghosh, Soumyabrata Pal, Subhadip Baidya, Sriparna Saha, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) IIT Bombay(印度理工学院班加罗尔分校) IIT Patna(印度理工学院帕坦分校) Adobe Research(Adobe 研究院) IIT Kanpur(印度理工学院坎普尔分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17482 2025-05-27 cs.CY cs.AI cs.CL cs.HC 82%

Reinforcement Learning from Human Feedback: Whose Culture, Whose Values, Whose Perspectives?

Kristian González Barman, Simon Lohse, Henk de Regt

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Journal ref González Barman, K., Lohse, S. & de Regt, H.W. Reinforcement Learning from Human Feedback in LLMs: Whose Culture, Whose Values, Whose Perspectives?. Philos. Technol. 38, 35 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏