arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2403.03419 2024-10-01 cs.CL cs.AI 86%

Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimization

Shitong Duan, Xiaoyuan Yi, Peng Zhang, Yan Liu, Zheng Liu, Tun Lu, Xing Xie, Ning Gu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16751 2024-08-30 cs.CL cs.LG stat.ML 86%

A Gradient Analysis Framework for Rewarding Good and Penalizing Bad Examples in Language Models

Yi-Lin Tuan, William Yang Wang

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16032 2024-08-30 cs.LG cs.AI cs.IR 86%

An Extremely Data-efficient and Generative LLM-based Reinforcement Learning Agent for Recommenders

Shuang Feng, Grace Feng

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13709 2024-08-23 cs.CL cs.LG 86%

Understanding Reference Policies in Direct Preference Optimization

Yixin Liu, Pengfei Liu, Arman Cohan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments GitHub Repo: https://github.com/yale-nlp/refdpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03708 2024-08-20 cs.LG cs.AI 86%

Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization

Zhanhui Zhou, Jie Liu, Jing Shao, Xiangyu Yue, Chao Yang, Wanli Ouyang, Yu Qiao

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03716 2024-07-12 cs.CL cs.LG 86%

A Long Way to Go: Investigating Length Correlations in RLHF

Prasann Singhal, Tanya Goyal, Jiacheng Xu, Greg Durrett

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 13 figures, Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06606 2024-07-09 cs.CL cs.AI 86%

Prototypical Reward Network for Data-Efficient RLHF

Jinghan Zhang, Xiting Wang, Yiqiao Jin, Changyu Chen, Xinhao Zhang, Kunpeng Liu

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10977 2024-06-18 cs.CL cs.AI 86%

Toward Optimal LLM Alignments Using Two-Player Games

Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Hang Li, Yang Liu

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Our code is released at https://github.com/ruizheng20/gpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05587 2024-06-11 cs.CL cs.AI 86%

Creativity Has Left the Chat: The Price of Debiasing Language Models

Behnam Mohammadi

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14979 2024-06-07 cs.LG cs.CL stat.ME 86%

Optimizing Language Models for Human Preferences is a Causal Inference Problem

Victoria Lin, Eli Ben-Michael, Louis-Philippe Morency

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

Comments UAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16682 2024-04-24 cs.CL cs.AI 86%

Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss

Jing Xu, Andrew Lee, Sainbayar Sukhbaatar, Jason Weston

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12150 2024-04-19 cs.LG cs.CL 86%

Aligning language models with human preferences

Tomasz Korbak

专题命中 后训练与偏好优化 :language model(title,abstract);pretraining(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08570 2024-04-15 cs.RO cs.AI cs.LG 86%

Enhancing Autonomous Vehicle Training with Language Model Integration and Critical Scenario Generation

Hanlin Tian, Kethan Reddy, Yuxiang Feng, Mohammed Quddus, Yiannis Demiris, Panagiotis Angeloudis

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00409 2024-04-15 cs.LG cs.CL 86%

Provably Robust DPO: Aligning Language Models with Noisy Feedback

Sayak Ray Chowdhury, Anush Kini, Nagarajan Natarajan

专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00495 2024-04-02 cs.CL cs.AI 86%

Configurable Safety Tuning of Language Models with Synthetic Preference Data

Victor Gallego

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16430 2024-03-26 cs.LG cs.AI 86%

Preference as Reward, Maximum Preference Optimization with Importance Sampling

Zaifan Jiang, Xing Huang, Chao Wei

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07691 2024-03-15 cs.CL cs.AI 86%

ORPO: Monolithic Preference Optimization without Reference Model

Jiwoo Hong, Noah Lee, James Thorne

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04792 2024-03-04 cs.AI cs.CL cs.HC 86%

Direct Language Model Alignment from Online AI Feedback

Shangmin Guo, Biao Zhang, Tianlin Liu, Tianqi Liu, Misha Khalman, Felipe Llinares, Alexandre Rame, Thomas Mesnard, Yao Zhao, Bilal Piot, Johan Ferret, Mathieu Blondel

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16030 2024-02-27 cs.CL cs.AI 86%

Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration

Xin Mao, Feng-Lin Li, Huimin Xu, Wei Zhang, Anh Tuan Luu

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 19 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12222 2024-02-20 cs.CR cs.CL cs.LG cs.SE 86%

CovRL: Fuzzing JavaScript Engines with Coverage-Guided Reinforcement Learning for LLM-based Mutation

Jueon Eom, Seyeon Jeong, Taekyoung Kwon

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 4 figures, 9 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16271 2023-10-26 cs.CL cs.AI 86%

CycleAlign: Iterative Distillation from Black-box LLM to White-box Models for Better Human Alignment

Jixiang Hong, Quan Tu, Changyu Chen, Xing Gao, Ji Zhang, Rui Yan

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10202 2023-09-20 cs.CL cs.AI 86%

Stabilizing RLHF through Advantage Model and Selective Rehearsal

Baolin Peng, Linfeng Song, Ye Tian, Lifeng Jin, Haitao Mi, Dong Yu

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15075 2023-05-25 cs.CL cs.AI 86%

HuatuoGPT, towards Taming Language Model to Be a Doctor

Hongbo Zhang, Junying Chen, Feng Jiang, Fei Yu, Zhihong Chen, Jianquan Li, Guiming Chen, Xiangbo Wu, Zhiyi Zhang, Qingying Xiao, Xiang Wan, Benyou Wang, Haizhou Li

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19504 2025-11-26 cs.LG stat.ML 86%

Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma

位置:完美AI对齐的复杂性——形式化RLHF三重困境

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究提出RLHF三重困境,指出在安全、公平和稳健之间存在根本性权衡,并通过复杂性分析证明实现全球代表性需要超多项式计算资源。

Comments Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13948 2025-02-25 cs.CL 86%

Aligning Language Models Using Follow-up Likelihood as Reward Signal

Chen Zhang, Dading Chong, Feng Jiang, Chengguang Tang, Anningzhe Gao, Guohua Tang, Haizhou Li

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,comments);preference optimization(abstract);分类 cs.CL

Comments Accepted by AAAI-2025, 16 pages, reward model, LLM Alignment, code repository at (https://github.com/e0397123/FLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26115 2026-07-30 cs.CR cs.AI cs.CL cs.LG 新提交 86%

GPT-Red: Automated Red Teaming via Self-Play at Scale

GPT-Red:基于大规模自博弈的自动化红队测试

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。

Comments 28 pages.13 main pages and 13 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18037 2026-07-07 cs.LG cs.AI cs.CL 版本更新 86%

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Mila(蒙特利尔大学Mila)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。

Comments Accepted at ICML 2026, 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 86%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08620 2026-06-09 cs.DB 新提交 86%

SPA: A SQL-Plan-Aware Reinforcement Learning Framework for Query Rewriting with LLMs

SPA:一种面向LLM查询重写的SQL计划感知强化学习框架

Xinyi Huang, Zhengjie Miao

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn)

AI总结 提出SPA框架,利用物理执行反馈训练LLM重写SQL查询,通过概率门控自适应奖励塑形和策略自改进,显著提升端到端运行时性能并减少有害重写。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07315 2026-06-08 cs.CL cs.AI cs.LG cs.SE 版本更新 86%

SWE-IF: Aligning Code Evaluation with Human Preference

SWE-IF: 使代码评估与人类偏好对齐

Ming Zhong, Xiang Zhou, Ting-Yun Chang, Qingze Wang, Nan Xu, Xiance Si, Dan Garrette, Shyam Upadhyay, Jeremiah Liu, Jiawei Han, Benoit Schillings, Jiao Sun

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SWE-IF基准,通过可验证指令分类法VeriCode评估代码指令遵循能力,发现指令遵循是区分LLM代码质量的关键,与功能正确性结合更能匹配人类偏好。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏