arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4526 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4526 篇

2502.11455 2025-02-18 cs.CR 85%

Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training

Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang, Wenjie Wang

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06761 2025-01-14 cs.CV 85%

VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning

Ji Soo Lee, Jongha Kim, Jeehye Na, Jinyoung Park, Hyunwoo J. Kim

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06691 2024-12-31 cs.LG cs.AI cs.CL 85%

Geometric-Averaged Preference Optimization for Soft Preference Labels

Hiroki Furuta, Kuang-Huei Lee, Shixiang Shane Gu, Yutaka Matsuo, Aleksandra Faust, Heiga Zen, Izzeddin Gur

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08925 2024-12-30 cs.CL cs.AI cs.LG cs.RO 85%

MaxMin-RLHF: Alignment with Diverse Human Preferences

Souradip Chakraborty, Jiahao Qiu, Hui Yuan, Alec Koppel, Furong Huang, Dinesh Manocha, Amrit Singh Bedi, Mengdi Wang

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11909 2024-11-26 cs.CV 85%

SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization

Hongrui Jia, Chaoya Jiang, Haiyang Xu, Wei Ye, Mengfan Dong, Ming Yan, Ji Zhang, Fei Huang, Shikun Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17126 2024-10-23 cs.CL cs.AI cs.LG 85%

Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards

Alexander G. Padula, Dennis J. N. J. Soemers

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at BNAIC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09603 2024-09-17 cs.AI cs.CL cs.LG 85%

Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison

Judy Hanwen Shen, Archit Sharma, Jun Qin

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05530 2024-08-07 cs.CL cs.AI cs.CR cs.LG 85%

Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data

Tim Baumgärtner, Yang Gao, Dana Alon, Donald Metzler

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01377 2024-07-17 cs.CL cs.AI cs.LG 85%

UltraFeedback: Boosting Language Models with Scaled AI Feedback

Ganqu Cui, Lifan Yuan, Ning Ding, Guanming Yao, Bingxiang He, Wei Zhu, Yuan Ni, Guotong Xie, Ruobing Xie, Yankai Lin, Zhiyuan Liu, Maosong Sun

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2024 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07971 2024-06-14 cs.CL cs.AI cs.LG 85%

It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF

Taiming Lu, Lingfeng Shen, Xinyu Yang, Weiting Tan, Beidi Chen, Huaxiu Yao

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02992 2024-05-27 cs.LG cs.AI cs.CL 85%

Decoding-time Realignment of Language Models

Tianlin Liu, Shangmin Guo, Leonardo Bianco, Daniele Calandriello, Quentin Berthet, Felipe Llinares, Jessica Hoffmann, Lucas Dixon, Michal Valko, Mathieu Blondel

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Proceedings of the 41st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08495 2024-04-17 cs.LG cs.AI cs.CL 85%

Dataset Reset Policy Optimization for RLHF

Jonathan D. Chang, Wenhao Zhan, Owen Oertell, Kianté Brantley, Dipendra Misra, Jason D. Lee, Wen Sun

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 6 tables, 3 Figures, 3 Algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16714 2024-04-01 cs.CV 85%

Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorld

Yijun Yang, Tianyi Zhou, Kanxue Li, Dapeng Tao, Lusong Li, Li Shen, Xiaodong He, Jing Jiang, Yuhui Shi

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16755 2024-02-26 cs.CL cs.AI cs.LG 85%

Training Language Models with Language Feedback at Scale

Jérémy Scheurer, Jon Ander Campos, Tomasz Korbak, Jun Shern Chan, Angelica Chen, Kyunghyun Cho, Ethan Perez

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in TMLR: https://openreview.net/forum?id=xo3hI5MwvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11882 2024-02-20 cs.CV 85%

NOTE: Notable generation Of patient Text summaries through Efficient approach based on direct preference optimization

Imjin Ahn, Hansle Gwon, Young-Hak Kim, Tae Joon Jun, Sanghyun Park

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07319 2024-02-13 cs.LG cs.AI cs.CL 85%

ODIN: Disentangled Reward Mitigates Hacking in RLHF

Lichang Chen, Chen Zhu, Davit Soselia, Jiuhai Chen, Tianyi Zhou, Tom Goldstein, Heng Huang, Mohammad Shoeybi, Bryan Catanzaro

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16335 2024-01-30 cs.LG cs.AI cs.CL stat.ML 85%

Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF

Banghua Zhu, Michael I. Jordan, Jiantao Jiao

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11589 2023-10-19 cs.CL cs.AI cs.LG 85%

Eliciting Human Preferences with Language Models

Belinda Z. Li, Alex Tamkin, Noah Goodman, Jacob Andreas

专题命中 后训练与偏好优化 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09251 2022-12-20 cs.CL cs.AI cs.LG 85%

Discovering Language Model Behaviors with Model-Written Evaluations

Ethan Perez, Sam Ringer, Kamilė Lukošiūtė, Karina Nguyen, Edwin Chen, Scott Heiner, Craig Pettit, Catherine Olsson, Sandipan Kundu, Saurav Kadavath, Andy Jones, Anna Chen, Ben Mann, Brian Israel, Bryan Seethor, Cameron McKinnon, Christopher Olah, Da Yan, Daniela Amodei, Dario Amodei, Dawn Drain, Dustin Li, Eli Tran-Johnson, Guro Khundadze, Jackson Kernion, James Landis, Jamie Kerr, Jared Mueller, Jeeyoon Hyun, Joshua Landau, Kamal Ndousse, Landon Goldberg, Liane Lovitt, Martin Lucas, Michael Sellitto, Miranda Zhang, Neerav Kingsland, Nelson Elhage, Nicholas Joseph, Noemí Mercado, Nova DasSarma, Oliver Rausch, Robin Larson, Sam McCandlish, Scott Johnston, Shauna Kravec, Sheer El Showk, Tamera Lanham, Timothy Telleen-Lawton, Tom Brown, Tom Henighan, Tristan Hume, Yuntao Bai, Zac Hatfield-Dodds, Jack Clark, Samuel R. Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, Jared Kaplan

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments for associated data visualizations, see https://www.evals.anthropic.com/model-written/ for full datasets, see https://github.com/anthropics/evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14146 2022-11-18 cs.CL cs.AI cs.LG 85%

Training Language Models with Language Feedback

Jérémy Scheurer, Jon Ander Campos, Jun Shern Chan, Angelica Chen, Kyunghyun Cho, Ethan Perez

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The First Workshop on Learning with Natural Language Supervision at ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17171 2026-08-19 cs.CL cs.DB 新提交 84%

Polaris: Learning to Generate Table Descriptions from Retrieval Feedback

Polaris:基于检索反馈学习生成表格描述

Ting Cai, Tuan Minh Phan, AnHai Doan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL

AI总结 Polaris是基于检索反馈训练LLM生成表格描述的系统,通过BM25排序和DPO微调优化检索效果,性能优于AutoDDG,证明检索基准可用于训练LLM生成面向检索的元数据。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15530 2026-08-18 cs.CL 新提交 84%

Why Summaries Turn Neutral: Policy Attribution for Sentiment Drift in Reinforcement Learning from Human Feedback

为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因

Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova, Grigori Sidorov

机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) Centro de Investigación en Computación (CIC)(计算机研究中心)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14791 2026-08-18 cs.AI 新提交 84%

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习

Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学) University of Tehran(德黑兰大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。

Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新 84%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08046 2026-08-11 cs.AI 新提交 84%

JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

JustLLMGRPO:面向胸部X射线生成的放射学控制

Pengxiang Cai, Xiaohan Li, Anglin Liu, Qingyuan Zeng, Zexun Li, Jintai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 84%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新 84%

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01130 2026-08-04 cs.LG 新提交 84%

When Do Surrogate Updates Improve Decisions? A Local Theory of Trajectory-Wise Transfer

替代更新何时能改进决策?轨迹式迁移的局部理论

Yuyang Shen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。

Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12501 2026-08-04 cs.LG 84%

Reinforcement Learning from Human Feedback

基于人类反馈的强化学习

Nathan Lambert

机构 * Nathan Lambert(纳瑟恩·拉姆伯特)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本书系统介绍强化学习从人类反馈的核心方法,涵盖指令微调、奖励模型训练及拒绝采样等关键技术,探讨合成数据与评估中的前沿问题。

Comments 239 pages. Web-native version at https://rlhfbook.com/ Continually improving, latest version at website

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10601 2026-07-14 cs.AI 新提交 84%

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO:从专家轨迹上的模仿到智能体策略优化

Yixiong Chen, Alan Yuille

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏