arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2602.08259 2026-02-10 stat.ML cs.LG 81%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05553 2026-01-22 cs.CL cs.CY 81%

Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs

政治观点在西方语言之间是否转移?对未对齐和对齐的多语言大语言模型的分析

Franziska Weeber, Tanise Ceron, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学) Bocconi University(博科尼大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究探讨多语言大语言模型在五种西方语言中政治观点的转移情况,发现对齐前模型观点差异小,对齐后观点在各语言间均匀转移。

Comments EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 81%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 81%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21915 2025-12-29 cs.LG cs.DB 81%

Exploring the Heterogeneity of Tabular Data: A Diversity-aware Data Generator via LLMs

探索表格数据的异质性:通过LLMs的多样性感知数据生成器

Yafeng Tang, Xiaoou Ding, Jianzhuo Du, Zishuo Yan, Zhuang Ma, Zheng Liang, Zekai Qian, Hongzhi Wang

机构 * Hongzhi Wang(王 Hongzhi)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 DATE通过LLMs生成多样化且高质量的表格数据,有效提升机器学习模型的性能与推理能力。

Comments This manuscript has been submitted to IEEE Transactions on Knowledge and Data Engineering (TKDE) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04453 2025-12-23 cs.LG 81%

ESSA: Evolutionary Strategies for Scalable Alignment

ESSA:可扩展对齐的进化策略

Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

机构 * T-Tech

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21983 2025-12-16 cs.LG 81%

Improving Generative Ad Text on Facebook using Reinforcement Learning

通过强化学习改进Facebook上的生成广告文本

Daniel R. Jiang, Alex Nikulkov, Yu-Chia Chen, Yang Bai, Zheqing Zhu

机构 * Meta Platforms(Meta平台)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过强化学习改进Facebook广告文本生成,提升点击率和广告效果

Comments D.J. and A.N. contributed equally, 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 81%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12723 2025-12-05 cs.CL 81%

On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding

基于组等价偏好的多编程语言理解的在线优化

Haoyuan Wu, Rui Ming, Jilong Gao, Hangyu Zhao, Xueyi Chen, Yikai Yang, Haisheng Zheng, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) ChatEDA Tech(ChatEDA科技)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出OORL框架和GEPO方法,通过代码翻译任务提升LLMs对多编程语言代码功能的理解和跨语言关系的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12565 2025-12-01 cs.CL 81%

Self Iterative Label Refinement via Robust Unlabeled Learning

通过鲁棒无标签学习实现自迭代标签细化

Hikaru Asano, Tadashi Kozuno, Yukino Baba

机构 * The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种通过鲁棒无标签学习实现自迭代标签细化的方法,有效提升了LLM在分类任务中的性能,并在安全对齐和生成任务中展示了优越性。

Comments To appear in the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08746 2025-11-26 cs.LG 81%

Interpretable Reward Model via Sparse Autoencoder

通过稀疏自编码器的可解释奖励模型

Shuyi Zhang, Wei Shi, Sihang Li, Jiayi Liao, Hengxing Cai, Xiang Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SARM通过整合预训练稀疏自编码器,提升奖励模型的可解释性和对齐性能。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18397 2025-11-25 cs.AI cs.SE 81%

Natural Emergent Misalignment from Reward Hacking in Production RL

生产强化学习中奖励黑客导致的自然涌现偏差

Monte MacDiarmid, Benjamin Wright, Jonathan Uesato, Joe Benton, Jon Kutasov, Sara Price, Naia Bouscal, Sam Bowman, Trenton Bricken, Alex Cloud, Carson Denison, Johannes Gasteiger, Ryan Greenblatt, Jan Leike, Jack Lindsey, Vlad Mikulik, Ethan Perez, Alex Rodrigues, Drake Thomas, Albert Webson, Daniel Ziegler, Evan Hubinger

机构 * Anthropic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

AI总结 研究发现大型语言模型在生产强化学习环境中学习奖励黑客会导致严重偏差,提出三种缓解措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20995 2025-11-12 cs.CL 81%

ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models

Xiaomin Li, Xupeng Chen, Jingxuan Fan, Eric Hanchen Jiang, Mingye Gao

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07520 2025-10-24 cs.SD cs.AI eess.AS 81%

LeVo: High-Quality Song Generation with Multi-Preference Alignment

Shun Lei, Yaoxun Xu, Zhiwei Lin, Huaicheng Zhang, Wei Tan, Hangting Chen, Jianwei Yu, Yixuan Zhang, Chenyu Yang, Haina Zhu, Shuai Wang, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院) Tencent AI Lab(腾讯AI实验室) Wuhan University(武汉大学) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) X-LANCE Lab, Shanghai Jiao Tong University, Shanghai(上海交通大学X-LANCE实验室) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18147 2025-10-22 cs.CL 81%

LLMs Encode How Difficult Problems Are

William Lugoloobi, Chris Russell

机构 * University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03459 2025-10-16 cs.LG 81%

Can DPO Learn Diverse Human Values? A Theoretical Scaling Law

Shawn Im, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06370 2025-10-13 cs.CL 81%

EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences

Kshitish Ghate, Andy Liu, Devansh Jain, Taylor Sorensen, Atoosa Kasirzadeh, Aylin Caliskan, Mona T. Diab, Maarten Sap

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05169 2025-10-08 cs.CR cs.AI 81%

From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs

Guangyu Shen, Siyuan Cheng, Xiangzhe Xu, Yuan Zhou, Hanxi Guo, Zhuo Zhang, Xiangyu Zhang

机构 * Purdue University(普渡大学) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26514 2025-10-01 cs.CL 81%

BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs

Yue Wang, Ruotian Ma, Xingyu Chen, Zhengliang Shi, Wanshun Chen, Huang Liu, Jiadi Yao, Qu Yang, Qingxuan Jiang, Fanghua Ye, Juntao Li, Min Zhang, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25771 2025-10-01 cs.CV cs.AI 81%

Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs

Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Kling Team, Kuaishou Technology(快手科技 Kling 团队) NSERC CRC Chair(加拿大NSERC CRC主席)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25047 2025-09-30 cs.AI 81%

Scaling Synthetic Task Generation for Agents via Exploration

Ram Ramrakhya, Andrew Szot, Omar Attia, Yuhao Yang, Anh Nguyen, Bogdan Mazoure, Zhe Gan, Harsh Agrawal, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13310 2025-09-17 cs.CL 81%

Scaling Agents via Continual Pre-training

Liangcai Su, Zhen Zhang, Guangyu Li, Zhuo Chen, Chenxi Wang, Maojia Song, Xinyu Wang, Kuan Li, Jialong Wu, Xuanzhong Chen, Zile Qiao, Zhongwang Zhang, Huifeng Yin, Shihao Cai, Runnan Fang, Zhengwei Tao, Wenbiao Yin, Chenxiong Qian, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05070 2025-08-06 cs.CL 81%

RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation

Tianjiao Li, Mengran Yu, Chenyu Shi, Yanjun Zhao, Xiaojing Liu, Qiang Zhang, Qi Zhang, Xuanjing Huang, Jiayin Wang

机构 * Bilibili Inc.(哔哩哔哩公司) Xi’an Jiaotong University(西安交通大学) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01368 2025-07-03 cs.CV cs.LG 81%

Activation Reward Models for Few-Shot Model Alignment

Tianning Chai, Chancharik Mitra, Brandon Huang, Gautam Rajendrakumar Gare, Zhiqiu Lin, Assaf Arbelle, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Deva Ramanan, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20653 2025-06-18 cs.AI 81%

Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries

Jiahao Yu, Haozheng Luo, Jerry Yao-Chieh Hu, Wenbo Guo, Han Liu, Xinyu Xing

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments published at USENIX Security 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08681 2025-06-12 cs.LG 81%

Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling

Phuc Minh Nguyen, Ngoc-Hieu Nguyen, Duy H. M. Nguyen, Anji Liu, An Mai, Binh T. Nguyen, Daniel Sonntag, Khoa D. Doan

机构 * VinUniversity(文大学) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) University of Stuttgart(斯图加特大学) University of California Los Angeles (UCLA)(加州大学洛杉矶分校) International University - VNUHCM(国际大学 - VNUHCM) University of Science - VNUHCM(科学大学 - VNUHCM) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Oldenburg University(奥尔登堡大学) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments First version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23634 2025-05-30 cs.LG cs.CR 81%

MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment

John Halloran

机构 * Leidos(莱迪斯公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments 27 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22653 2025-05-29 cs.CL 81%

The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason

Ang Lv, Ruobing Xie, Xingwu Sun, Zhanhui Kang, Rui Yan

机构 * GSAI, Renmin University of China(清华大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Macau(澳门大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20871 2025-05-28 cs.CL 81%

Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG

Xin Sun, Jianan Xie, Zhongqi Chen, Qiang Liu, Shu Wu, Yuehe Chen, Bowen Song, Weiqiang Wang, Zilei Wang, Liang Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14946 2025-05-22 cs.AI 81%

Reinforcement Learning from User Feedback

Eric Han, Jun Chen, Karthik Abinav Sankararaman, Xiaoliang Peng, Tengyu Xu, Eryk Helenowski, Kaiyan Peng, Mrinal Kumar, Sinong Wang, Han Fang, Arya Talebzadeh

机构 * Meta GenAI(Meta 生成式人工智能)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏