arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2310.15694 2024-03-27 cs.LG cs.CL 73%

COPR: Continual Learning Human Preference through Optimal Policy Regularization

Han Zhang, Lin Gui, Yuanzhao Zhai, Hui Wang, Yu Lei, Ruifeng Xu

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14238 2024-03-22 cs.CL cs.AI 73%

Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection

Kyungjae Lee, Dasol Hwang, Sunghyun Park, Youngsoo Jang, Moontae Lee

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 5 figures, Submitted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01967 2024-01-05 cs.CL cs.AI 73%

A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity

Andrew Lee, Xiaoyan Bai, Itamar Pres, Martin Wattenberg, Jonathan K. Kummerfeld, Rada Mihalcea

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11971 2023-12-27 cs.LG cs.AI 73%

Improving Generalization of Alignment with Human Preferences through Group Invariant Learning

Rui Zheng, Wei Shen, Yuan Hua, Wenbin Lai, Shihan Dou, Yuhao Zhou, Zhiheng Xi, Xiao Wang, Haoran Huang, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12842 2023-10-30 cs.LG cs.AI 73%

Direct Preference-based Policy Optimization without Reward Modeling

Gaon An, Junhyeok Lee, Xingdong Zuo, Norio Kosaka, Kyung-Min Kim, Hyun Oh Song

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04488 2023-10-17 cs.LG cs.AI cs.CV 73%

Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards

Alexandre Ramé, Guillaume Couairon, Mustafa Shukor, Corentin Dancette, Jean-Baptiste Gaya, Laure Soulier, Matthieu Cord

专题命中 后训练与偏好优化 :foundation model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11288 2023-07-24 cs.LG cs.AI stat.ML 73%

Kernelized Offline Contextual Dueling Bandits

Viraj Mehta, Ojash Neopane, Vikramjeet Das, Sen Lin, Jeff Schneider, Willie Neiswanger

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10425 2023-05-18 cs.CL cs.AI 73%

SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Yao Zhao, Rishabh Joshi, Tianqi Liu, Misha Khalman, Mohammad Saleh, Peter J. Liu

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09726 2022-11-16 cs.CL cs.LG 73%

RankGen: Improving Text Generation with Large Ranking Models

Kalpesh Krishna, Yapei Chang, John Wieting, Mohit Iyyer

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2022 (34 pages), model checkpoints available at https://github.com/martiansideofthemoon/rankgen. Added comparisons to newer decoding methods (contrastive search, contrastive decoding, eta sampling)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12093 2022-02-25 cs.CL cs.AI 73%

KESA: A Knowledge Enhanced Approach For Sentiment Analysis

Qinghua Zhao, Shuai Ma, Shuo Ren

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25111 2026-04-28 cs.LG cs.PL cs.SE 72%

SEVerA: Verified Synthesis of Self-Evolving Agents

SEVerA: 验证合成自进化代理

Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。

Comments First Formally Verified Self-Evolving LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07307 2025-09-16 cs.CL 72%

Multi-Agent Retrieval-Augmented Framework for Evidence-Based Counterspeech Against Health Misinformation

Anirban Saha Anik, Xiaoying Song, Elliott Wang, Bryan Wang, Bengisu Yarimbas, Lingzi Hong

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 后训练与偏好优化 :language model(abstract,journal_ref);large language model(abstract);分类 cs.CL

Comments Accepted for publication at COLM 2025

Journal ref Second Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09244 2024-08-20 cs.LG 72%

Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking

Jacob Eisenstein, Chirag Nagpal, Alekh Agarwal, Ahmad Beirami, Alex D'Amour, DJ Dvijotham, Adam Fisch, Katherine Heller, Stephen Pfohl, Deepak Ramachandran, Peter Shaw, Jonathan Berant

专题命中 后训练与偏好优化 :language model(abstract,comments);pretraining(abstract);分类 cs.LG

Comments Published at the 2024 Conference on Language Modeling (CoLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05199 2023-11-30 cs.CL 72%

Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback

Wei Shen, Rui Zheng, Wenyu Zhan, Jun Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL;RLHF(comments)

Comments EMNLP 2023 findings, Length Bias in RLHF, Mitigate bias in reward modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05821 2023-11-13 cs.CL 72%

Let's Reinforce Step by Step

Sarah Pan, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL;instruction tuning(comments)

Comments NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13924 2026-08-17 cs.RO 新提交 71%

BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control

BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化

Ming Shang, Yuchen Huang, Jiaoyang Chen, Haoyuan Hu, Han Yu, Liping Song, Luyun Feng, Shuo Bao, Wei Dong, Xinzhou Wang, Fuchun Sun

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15499 2026-06-16 cs.CR 版本更新 71%

HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment

HarmRLVR: 利用可验证奖励进行有害大模型对齐

Yuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao

专题命中 后训练与偏好优化 :LLM(title)

AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28615 2026-05-28 cs.CV 71%

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

基于区域感知双模态直接偏好优化的组合式文本到图像生成

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 提出BiDPO框架,通过构建大规模偏好数据集BiComp和扩展Diffusion DPO联合优化图像与文本偏好,结合区域级引导方法,提升文本到图像模型对复杂组合提示的生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05947 2026-05-13 cs.CV 71%

LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution

LucidNFT: 基于LR锚定的多奖励偏好优化用于基于流的现实世界超分辨率

Song Fei, Tian Ye, Sixiang Chen, Zhaohu Xing, Jianyu Lai, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 本文提出LucidNFT框架,通过引入LucidConsistency、解耦奖励归一化策略和LucidLR数据集,解决现实世界超分辨率中LR参考一致性、奖励优化瓶颈和真实退化覆盖不足的问题,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15311 2026-04-17 cs.CV 71%

LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

LeapAlign: 通过构建两步轨迹实现任意生成步骤的训练后流匹配模型对齐

Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng

机构 * The Australian National University(澳大利亚国立大学)

专题命中 后训练与偏好优化 :post-training(title)

AI总结 本文提出LeapAlign方法,通过缩短生成轨迹为两步,减少计算成本并实现早期生成步骤的梯度传播,提升模型更新效率与稳定性,优于现有方法。

Comments Accepted by CVPR 2026. Project page: https://rockeycoss.github.io/leapalign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02225 2026-03-31 math.OC 71%

Human-in-the-loop: Real-time Preference Optimization

人机协同:实时偏好优化

Wenbin Wang, Wenjie Xu, Colin N. Jones

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 本文提出一种实时反馈优化控制器,通过成对比较反馈优化用户效用,保证最优性和闭环稳定性,通过随机探索信号估计下降方向,并通过数值实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06783 2025-12-05 cs.CV 71%

TTRV: Test-Time Reinforcement Learning for Vision Language Models

TTRV:用于视觉语言模型的测试时间强化学习

Akshit Singh, Shyam Marjit, Wei Lin, Paul Gavrikov, Serena Yeung-Levy, Hilde Kuehne, Rogerio Feris, Sivan Doveh, James Glass, M. Jehanzeb Mirza

机构 * IISc Bangalore(班加罗尔印度理工学院) JKU Linz(林茨约翰·凯撒大学) Stanford(斯坦福大学) Tübingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) MIT CSAIL Project(麻省理工CSAIL项目)

专题命中 后训练与偏好优化 :language model(title)

AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19213 2025-07-28 cs.CV 71%

PRE-MAP: Personalized Reinforced Eye-tracking Multimodal LLM for High-Resolution Multi-Attribute Point Prediction

Hanbing Wu, Ping Jiang, Anyang Su, Chenxu Zhao, Tianyu Fu, Minghui Wu, Beiping Tan, Huiying Li

机构 * Jilin University(吉林大学) Peking University(北京大学) Mininglamp Technology(Mininglamp科技)

专题命中 后训练与偏好优化 :LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12890 2025-07-25 eess.AS cs.SD 71%

DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization

Huakang Chen, Yuepeng Jiang, Guobin Ma, Chunbo Hao, Shuai Wang, Jixun Yao, Ziqian Ning, Meng Meng, Jian Luan, Lei Xie

机构 * School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学,苏州,中国) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 后训练与偏好优化 :preference optimization(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20975 2025-05-28 cs.CV 71%

DreamBoothDPO: Improving Personalized Generation using Direct Preference Optimization

Shamil Ayupov, Maksim Nakhodnov, Anastasia Yaschenko, Andrey Kuznetsov, Aibek Alanov

机构 * HSE University(俄罗斯高等经济大学) AIRI Sber AI Sber Innopolis

专题命中 后训练与偏好优化 :preference optimization(title)

Comments The first two authors contributed equally. The source code can be found at https://github.com/ControlGenAI/DreamBoothDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12689 2025-03-18 cs.CV 71%

MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization

Hengjia Li, Lifan Jiang, Xi Xiao, Tianyang Wang, Hongwei Yi, Boxi Wu, Deng Cai

专题命中 后训练与偏好优化 :preference optimization(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21699 2026-08-20 cs.CL cs.IR 70%

Can David Beat Goliath? On Multi-Hop Reasoning with Resource-Constrained Agents

大卫能否击败歌利亚?关于资源受限代理的多跳推理

Hojae Han, Heeyun Jung, Jongyoon Kim, Seung-won Hwang

机构 * ETRI(电子技术研究所) The University of Hong Kong(香港大学) Seoul National University(首尔国立大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出David-GRPO方法,通过结合专家引导和证据指导探索,提升小批量学习效果,在多跳问答基准上优于现有RL基线,使代理更深入检索并覆盖更多证据。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17776 2026-08-19 cs.LG 新提交 70%

Debate Training Reduces Reward Hacking in RLAIF

辩论训练可减少RLAIF中的奖励黑客行为

Zachary Kenton, Lili Janzer, Rory Greig, Tian Huey Teh, Kirill Tyshchuk, Jonah Brown-Cohen, Harri Edwards, Senthooran Rajamanoharan, Noah Y. Siegel, Natasha Jaques, Rohin Shah

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出用辩论训练替代RLAIF基线,在数学任务中可减少奖励黑客行为,维持裁判性能并恢复45%的性能差距,还验证了多方面相关实验结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17289 2026-08-19 cs.AI 新提交 70%

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

PlanPO:面向多轮智能体大语言模型的组规划感知策略优化

Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 70%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏