arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2601.20848 2026-01-29 cs.LG cs.AI cs.CY cs.IR 81%

Post-Training Fairness Control: A Single-Train Framework for Dynamic Fairness in Recommendation

训练后公平性控制:一个用于推荐中动态公平性的单一训练框架

Weixin Chen, Li Chen, Yuhan Zhao

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 Cofair提出一个单一训练框架,通过共享表示层和公平性条件适配器模块,在推荐系统中实现动态公平性控制,无需重新训练即可适应不同公平性需求。

Comments Accepted to WWW 2026 Workshop on HCRS (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17329 2026-01-27 cs.LG cs.AI 81%

Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment

符合反馈对齐:量化答案级可靠性以实现鲁棒的大语言模型对齐

Tiejin Chen, Xiaoou Liu, Vishnu Nandam, Kuan-Ru Liou, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 Conformal Feedback Alignment通过量化答案级可靠性提升大语言模型对齐的鲁棒性和数据效率。

Comments Accetped to Findings of EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12205 2026-01-23 cs.LG cs.AI cs.IT math.IT math.ST stat.ML stat.TH 81%

On the Exponential Convergence for Offline RLHF with Pairwise Comparisons

关于通过成对比较进行离线RLHF的指数收敛性

Zhirui Chen, Vincent Y. F. Tan

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在离线RLHF中通过成对比较实现指数收敛的算法RL-LOW,并推导了实例依赖的下界。

Comments Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18913 2026-01-13 cs.LG cs.AI stat.ML 81%

ADPO: Anchored Direct Preference Optimization

ADPO:基于锚定的直接偏好优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东有限公司 Tai’an 分部)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 ADPO通过锚定logits优化相对优势,统一了监督微调、强化学习和排序目标,在推理任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22953 2025-12-30 cs.LG cs.AI 81%

APO: Alpha-Divergence Preference Optimization

APO:Alpha-散度偏好优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 APO通过alpha-散度在锚定几何中插值正反KL散度,实现稳定训练与探索平衡,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10767 2025-12-17 cs.LG cs.AI math.OC 81%

Understanding Sampler Stochasticity in Training Diffusion Models for RLHF

理解训练扩散模型用于RLHF中的采样随机性

Jiayuan Sheng, Hanyang Zhao, Haoxian Chen, David D. Yao, Wenpin Tang

机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 81%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23184 2025-12-01 cs.CL cs.AI 81%

Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction

基于元素混淆的列表偏好优化用于方面情感四元组预测

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭大) University of Technology Sydney(悉尼大学) The Education University of Hong Kong(香港教育大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于元素混淆的列表偏好优化方法,用于提升方面情感四元组预测的准确性和解释一致性。

Comments 11 pages, 7 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02433 2025-12-01 cs.LG cs.AI 81%

FairPO: Robust Preference Optimization for Fair Multi-Label Learning

FairPO: 为公平多标签学习的鲁棒偏好优化

Soumen Kumar Mondal, Prateek Chanda, Akshit Varmora, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 FairPO通过结合偏好损失和群体鲁棒优化,提升多标签学习中不同标签的公平性,通过针对性改进和平衡目标缓解偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04753 2025-11-10 cs.CV cs.AI cs.LG 81%

CPO: Condition Preference Optimization for Controllable Image Generation

Zonglin Lyu, Ming Li, Xinxin Liu, Chen Chen

机构 * Institute of Artificial Intelligence(人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03069 2025-10-28 cs.CL cs.AI 81%

ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization

YuXuan Zhang

机构 * South China Normal University(华南师范大学) University of Aberdeen(阿伯丁大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments This version fixes some minor typographical errors and adds more explanations to ensure clarity in presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18458 2025-10-24 cs.CL cs.AI cs.CV 81%

Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning

Wenyi Xiao, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18407 2025-10-17 cs.LG cs.AI 81%

KL-regularization Itself is Differentially Private in Bandits and RLHF

Yizhou Zhang, Kishan Panaganti, Laixi Shi, Juba Ziani, Adam Wierman

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14094 2025-10-15 cs.LG cs.AI 81%

Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets

Benjamin Pikus, Pratyush Ranjan Tiwari, Burton Ye

机构 * Independent(独立研究者) Eternis Labs(Eternis实验室) Writer, Inc(Writer公司)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06552 2025-10-14 cs.CL cs.LG 81%

References Indeed Matter? Reference-Free Preference Optimization for Conversational Query Reformulation

Doyoung Kim, Youngjun Lee, Joeun Kim, Jihwan Bang, Hwanjun Song, Susik Yoon, Jae-Gil Lee

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01774 2025-10-13 cs.LG cs.AI 81%

VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems

Shiyan Liu, Bohan Tan, Zhiguang Cao, Yan Jin

机构 * Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01555 2025-10-07 cs.LG cs.AI 81%

Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization

Kezhao Liu, Jason Klein Liu, Mingtao Chen, Yiming Liu

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09350 2025-10-03 cs.CV cs.AI cs.LG 81%

Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

Shanchuan Lin, Ceyuan Yang, Hao He, Jianwen Jiang, Yuxi Ren, Xin Xia, Yang Zhao, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08316 2025-10-03 cs.CV cs.AI cs.LG 81%

Diffusion Adversarial Post-Training for One-Step Video Generation

Shanchuan Lin, Xin Xia, Yuxi Ren, Ceyuan Yang, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21718 2025-09-29 cs.AI cs.LG eess.AS 81%

Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization

Shehzeen Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Ryan Langman, Mikyas Desta, Leili Tavabi, Jason Li

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20751 2025-09-26 cs.CV cs.AI cs.CL 81%

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models

Zoe Wanying He, Sean Trott, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系,加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18026 2025-09-09 cs.LG cs.AI 81%

Addressing Concept Mislabeling in Concept Bottleneck Models Through Preference Optimization

Emiliano Penaloza, Tianyue H. Zhang, Laurent Charlin, Mateo Espinosa Zarlenga

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12833 2025-08-13 cs.CV cs.AI cs.LG 81%

SPIE: Semantic and Structural Post-Training of Image Editing Diffusion Models with AI feedback

Elior Benarous, Yilun Du, Heng Yang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05838 2025-08-11 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 81%

Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction

Ahmad Farooq, Kamran Iqbal

机构 * University of Arkansas at Little Rock(阿拉伯塔大学拉夫洛克分校)

专题命中 后训练与偏好优化 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Published in the Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering (RCVE'25). 6 pages, 3 figures, 1 table

Journal ref RCVE'25: Proceedings of the 2025 3rd International Conference on Robotics, Control and Vision Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05273 2025-08-07 cs.RO cs.AI cs.LG 81%

Real-World Offline Reinforcement Learning from Vision Language Model Feedback

Sreyas Venkataraman, Yufei Wang, Ziyu Wang, Navin Sriram Ravie, Zackory Erickson, David Held

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格浦尔分校) IIIS, Tsinghua University(清华大学人工智能研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 7 pages. Accepted at the LangRob Workshop 2024 @ CoRL, 2024. Accepted at 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04883 2025-07-08 cs.LG cs.AI cs.CR 81%

Beyond Training-time Poisoning: Component-level and Post-training Backdoors in Deep Reinforcement Learning

Sanyam Vyas, Alberto Caron, Chris Hicks, Pete Burnap, Vasilios Mavroudis

机构 * Cardiff University(卡迪夫大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18383 2025-06-24 cs.LG cs.AI 81%

LOGICPO: Efficient Translation of NL-based Logical Problems to FOL using LLMs and Preference Optimization

Koushik Viswanadha, Deepanway Ghosal, Somak Aditya

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12350 2025-06-17 stat.ML cs.AI cs.LG 81%

Theoretical Tensions in RLHF: Reconciling Empirical Success with Inconsistencies in Social Choice Theory

Jiancong Xiao, Zhekun Shi, Kaizhao Liu, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21027 2025-06-16 cs.LG cs.CL 81%

Transferable Post-training via Inverse Value Learning

Xinyu Lu, Xueru Wen, Yaojie Lu, Bowen Yu, Hongyu Lin, Haiyang Yu, Le Sun, Xianpei Han, Yongbin Li

机构 * Chinese Information Processing Laboratory Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.LG

Comments NAACL 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09496 2025-06-12 cs.LG cs.AI 81%

EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization

Dingyi Rong, Haotian Lu, Wenzhuo Zheng, Fan Zhang, Shuangjia Zheng, Ning Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏