arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2508.14947 2025-08-26 cs.LG 79%

Linear Preference Optimization: Decoupled Gradient Control via Absolute Regularization

Rui Wang, Qianguo Sun, Chao Song, Junlong Wu, Tianrong Chen, Zhiyun Zeng, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) Emdoor Collaborative Laboratory(Emdoor协同实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13445 2025-08-20 cs.LG 79%

ASAP: Unsupervised Post-training with Label Distribution Shift Adaptive Learning Rate

Heewon Park, Mugon Joe, Miru Kim, Minhae Kwon

机构 * Soongsil University(顺斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments 5 pages, 3 figures, accepted for ACM CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10667 2025-08-15 cs.CV cs.AI 79%

AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models

Shixiong Xu, Chenghao Zhang, Lubin Fan, Yuan Zhou, Bin Fan, Shiming Xiang, Gaofeng Meng, Jieping Ye

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) CASIA(中国科学院自动化所) Alibaba Cloud(阿里云) School of Intelligence Science and Technology(智能科学与技术学院) CAIR(中国科学院香港创新研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23391 2025-08-01 cs.LG cs.RO 79%

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling

Tung M. Luu, Donghoon Lee, Younghwan Lee, Chang D. Yoo

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20566 2025-07-29 cs.AI 79%

Unlearning of Knowledge Graph Embedding via Preference Optimization

Jiajun Liu, Wenjun Ke, Peng Wang, Yao He, Ziyu Shang, Guozheng Li, Zijie Xu, Ke Ji

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03580 2025-07-18 cs.CL 79%

Learning to Translate Ambiguous Terminology by Preference Optimization on Post-Edits

Nathaniel Berger, Johannes Eschbach-Dymanus, Miriam Exel, Matthias Huck, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR) SAP SE(SAP公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07580 2025-06-03 cs.LG 79%

BOPO: Neural Combinatorial Optimization via Best-anchored and Objective-guided Preference Optimization

Zijun Liao, Jinbiao Chen, Debing Wang, Zizhen Zhang, Jiahai Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments This paper has been accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11163 2025-06-03 cs.CL 79%

Model Swarms: Collaborative Search to Adapt LLM Experts via Swarm Intelligence

Shangbin Feng, Zifeng Wang, Yike Wang, Sayna Ebrahimi, Hamid Palangi, Lesly Miculicich, Achin Kulshrestha, Nathalie Rauschmayr, Yejin Choi, Yulia Tsvetkov, Chen-Yu Lee, Tomas Pfister

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23651 2025-05-30 cs.LG cs.CV 79%

Merge-Friendly Post-Training Quantization for Multi-Target Domain Adaptation

Juncheol Shin, Minsang Seok, Seonggon Kim, Eunhyeok Park

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments ICML 2025. Code: https://github.com/ewsn1593/HDRQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21395 2025-05-28 cs.LG 79%

Square$χ$PO: Differentially Private and Robust $χ^2$-Preference Optimization in Offline Direct Alignment

Xingyu Zhou, Yulian Wu, Wenqian Weng, Francesco Orabona

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20556 2025-05-28 cs.LG 79%

Learning a Pessimistic Reward Model in RLHF

Yinglun Xu, Hangoo Kang, Tarun Suresh, Yuxuan Wan, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12754 2025-05-20 cs.LG 79%

ProDS: Preference-oriented Data Selection for Instruction Tuning

Wenya Guo, Zhengkun Zhang, Xumeng Liu, Ying Zhang, Ziyu Lu, Haoze Zhu, Xubo Liu, Ruxue Yan

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :instruction tuning(title);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11070 2025-05-19 cs.CV cs.AI 79%

Towards Self-Improvement of Diffusion Models via Group Preference Optimization

Renjie Chen, Wenfeng Lin, Yichen Zhang, Jiangchuan Wei, Boyuan Liu, Chao Feng, Jiao Ran, Mingyu Guo

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09574 2025-05-19 cs.LG 79%

Online Bandit Learning with Offline Preference Data for Improved RLHF

Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

机构 * University of Southern California(南加州大学) Google DeepMind(谷歌DeepMind) USC(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08735 2025-05-14 cs.LG 79%

Preference Optimization for Combinatorial Optimization Problems

Mingjun Pan, Guanquan Lin, You-Wei Luo, Bin Zhu, Zhien Dai, Lijun Sun, Chun Yuan

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments This paper has been accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05046 2025-05-07 cs.CV cs.CL 79%

FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback

Liqiang Jing, Xinya Du

机构 * Department of Computer Science, The University of Texas at Dallas(计算机科学系,德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00259 2025-05-02 cs.CV cs.AI 79%

Pack-PTQ: Advancing Post-training Quantization of Neural Networks by Pack-wise Reconstruction

Changjun Li, Runqing Jiang, Zhuo Song, Pengpeng Yu, Ye Zhang, Yulan Guo

机构 * Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20386 2025-04-08 cs.CV cs.LG 79%

PTQ4VM: Post-Training Quantization for Visual Mamba

Younghyun Cho, Changhun Lee, Seonggon Kim, Eunhyeok Park

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments Accepted at WACV 2025 (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01389 2025-04-03 cs.LG physics.chem-ph q-bio.BM 79%

De Novo Molecular Design Enabled by Direct Preference Optimization and Curriculum Learning

Junyu Hou

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19523 2025-03-27 cs.LG cs.CV 79%

One Framework to Rule Them All: Unifying RL-Based and RL-Free Methods in RLHF

Xin Cai

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04203 2025-03-04 cs.AI 79%

RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization

Hanyang Zhao, Genta Indra Winata, Anirban Das, Shi-Xiong Zhang, David D. Yao, Wenpin Tang, Sambit Sahu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12375 2025-02-19 cs.CL 79%

UltraGen: Extremely Fine-grained Controllable Generation via Attribute Reconstruction and Global Preference Optimization

Longfei Yun, Letian Peng, Jingbo Shang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12178 2025-02-19 cs.LG cs.MA 79%

Direct Preference Optimization-Enhanced Multi-Guided Diffusion Model for Traffic Scenario Generation

Seungjun Yu, Kisung Kim, Daejung Kim, Haewook Han, Jinhan Lee

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04625 2025-02-12 cs.LG stat.ML 79%

Sharp Analysis for KL-Regularized Contextual Bandits and RLHF

Heyang Zhao, Chenlu Ye, Quanquan Gu, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04567 2025-02-10 cs.AI 79%

Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator

Zhuotong Chen, Fang Liu, Xuan Zhu, Yanjun Qi, Mohammad Ghavamzadeh

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22110 2025-02-06 cs.LG 79%

Data Generation for Hardware-Friendly Post-Training Quantization

Lior Dikstein, Ariel Lapid, Arnon Netzer, Hai Victor Habi

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10892 2025-01-03 cs.LG 79%

DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Vinay P Namboodiri, Amrit Singh Bedi

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments This paper is subsumed by a later paper of ours: arXiv:2411.00361

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19005 2024-12-30 eess.AS cs.AI 79%

Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization

Yihan Wu, Yichen Lu, Yifan Peng, Xihua Wang, Ruihua Song, Shinji Watanabe

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17572 2024-12-24 cs.CV cs.AI 79%

Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor

Yeonju Kim, Se Jin Park, Yong Man Ro

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05622 2024-12-17 cs.LG 79%

Forward KL Regularized Preference Optimization for Aligning Diffusion Policies

Zhao Shan, Chenyou Fan, Shuang Qiu, Jiyuan Shi, Chenjia Bai

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏