arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2506.06292 2025-06-11 cs.LG cs.AI 79%

Mutual-Taught for Co-adapting Policy and Reward Models

Tianyuan Shi, Canbin Huang, Fanqi Wan, Longguang Zhong, Ziyi Yang, Weizhou Shen, Xiaojun Quan, Ming Yan

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(计算机科学与工程学院,中山大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07434 2025-06-10 cs.CL cs.AI 79%

Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding

Feifan Song, Shaohang Wei, Wen Luo, Yuxuan Fan, Tianyu Liu, Guoyin Wang, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science(多媒体信息处理国家重点实验室、计算机科学学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05598 2025-06-09 cs.CL cs.AI 79%

SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs

Michael J Ryan, Omar Shaikh, Aditri Bhagirath, Daniel Frees, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04647 2025-06-06 cs.CL cs.AI 79%

Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment

Wen Yang, Junhong Wu, Chen Wang, Chengqing Zong, Jiajun Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments Camera ready version for ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00418 2025-06-04 cs.CL cs.AI 79%

Self-Evolved Reward Learning for LLMs

Chenghua Huang, Zhizhen Fan, Lu Wang, Fangkai Yang, Pu Zhao, Zeqi Lin, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Microsoft(微软公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 23 pages,6 figures,Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00439 2025-06-03 cs.LG cs.AI 79%

RLAE: Reinforcement Learning-Assisted Ensemble for LLMs

Yuqian Fu, Yuanheng Zhu, Jiajun Chai, Guojun Yin, Wei Lin, Qichao Zhang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24709 2025-06-02 cs.LG cs.AI 79%

On Symmetric Losses for Robust Policy Optimization with Noisy Preferences

Soichiro Nishimori, Yu-Jie Zhang, Thanawat Lodkaew, Masashi Sugiyama

机构 * The University of Tokyo, Japan(东京大学) RIKEN AIP, Japan(日本理化学研究所AIP)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24500 2025-06-02 cs.CL cs.AI 79%

TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence

Guiyang Hou, Xing Gao, Yuchuan Wu, Xiang Huang, Wenqi Zhang, Zhe Zheng, Yongliang Shen, Jialu Du, Fei Huang, Yongbin Li, Weiming Lu

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22068 2025-05-29 cs.CL cs.AI cs.IR 79%

Beyond path selection: Better LLMs for Scientific Information Extraction with MimicSFT and Relevance and Rule-induced(R$^2$)GRPO

Ran Li, Shimin Di, Yuchen Liu, Chen Jing, Yu Qiu, Lei Chen

机构 * HKUST Hong Kong SAR, China(香港科技大学) SEU Jiangsu, China(江苏大学) HKUST(GZ) Guangzhou, China(香港科技大学(广州)) Zhipu AI Beijing, China(智谱AI) HKUST(GZ), HKUST Guangzhou, China(香港科技大学(广州)、香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18830 2025-05-27 cs.LG cs.CL 79%

On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization

Wenlong Deng, Yi Ren, Muchen Li, Danica J. Sutherland, Xiaoxiao Li, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11704 2025-05-26 cs.CL cs.LG 79%

From Lists to Emojis: How Format Bias Affects Model Alignment

Xuanchang Zhang, Wei Xiong, Lichang Chen, Tianyi Zhou, Heng Huang, Tong Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00814 2025-05-20 cs.LG cs.CL 79%

Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling

Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Yue Wang, Li Li, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09925 2025-05-16 cs.LG cs.AI 79%

Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback

Yutao Yang, Jie Zhou, Junsong Li, Qianjun Pan, Bihao Zhan, Qin Chen, Xipeng Qiu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06274 2025-05-13 cs.LG cs.AI 79%

PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model

Baijiong Lin, Weisen Jiang, Yuancheng Xu, Hao Chen, Ying-Cong Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12328 2025-04-18 cs.CL cs.AI 79%

A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future

Jialun Zhong, Wei Shen, Yanzeng Li, Songyang Gao, Hua Lu, Yicheng Chen, Yang Zhang, Wei Zhou, Jinjie Gu, Lei Zou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10166 2025-04-03 cs.LG cs.AI 79%

Automated Filtering of Human Feedback Data for Aligning Text-to-Image Diffusion Models

Yongjin Yang, Sihyeon Kim, Hojung Jung, Sangmin Bae, SangMook Kim, Se-Young Yun, Kimin Lee

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025; Project Page available at : https://sprain02.github.io/FiFA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09925 2025-03-14 cs.LG cs.CL 79%

PluralLLM: Pluralistic Alignment in LLMs via Federated Learning

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06810 2025-03-11 cs.LG cs.AI 79%

Mitigating Preference Hacking in Policy Optimization with Pessimism

Dhawal Gupta, Adam Fisch, Christoph Dann, Alekh Agarwal

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04201 2025-03-07 cs.CL cs.AI 79%

Knowledge-Decoupled Synergetic Learning: An MLLM based Collaborative Approach to Few-shot Multimodal Dialogue Intention Recognition

Bin Chen, Yu Zhang, Hongfei Ye, Ziyi Huang, Hongyang Chen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01902 2025-03-04 cs.CR cs.AI cs.CL 79%

SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters

Yan Yang, Zeguan Xiao, Xin Lu, Hongru Wang, Xuetao Wei, Hailiang Huang, Guanhua Chen, Yun Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11431 2025-03-03 cs.CL cs.AI 79%

Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization

Wenkai Yang, Shiqi Shen, Guangyao Shen, Wei Yao, Yong Liu, Zhi Gong, Yankai Lin, Ji-Rong Wen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICLR 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19328 2025-02-27 cs.CL cs.AI 79%

Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Bin Xu, Lei Hou, Juanzi Li

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16502 2025-02-27 cs.LG cs.AI 79%

Interpreting Language Reward Models via Contrastive Explanations

Junqi Jiang, Tom Bewley, Saumitra Mishra, Freddy Lecue, Manuela Veloso

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10573 2025-02-26 cs.CL cs.AI 79%

Putting People in LLMs' Shoes: Generating Better Answers via Question Rewriter

Junhao Chen, Bowen Wang, Zhouqiang Jiang, Yuta Nakashima

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 4 figures, 5 tables and accepted at AAAI 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17515 2025-02-26 cs.LG cs.AI 79%

Towards User-level Private Reinforcement Learning with Human Feedback

Jiaming Zhang, Mingxi Lei, Meng Ding, Mengdi Li, Zihang Xiang, Difei Xu, Jinhui Xu, Di Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12858 2025-02-19 cs.CL cs.AI cs.CY 79%

Rejected Dialects: Biases Against African American Language in Reward Models

Joel Mire, Zubin Trivadi Aysola, Daniel Chechelnitsky, Nicholas Deas, Chrysoula Zerva, Maarten Sap

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14596 2025-02-11 cs.CL cs.AI 79%

Teaching Models to Balance Resisting and Accepting Persuasion

Elias Stengel-Eskin, Peter Hase, Mohit Bansal

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments NAACL Camera-Ready. Code: https://github.com/esteng/persuasion_balanced_training

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05253 2025-02-11 cs.CL cs.AI 79%

LLMs Can Teach Themselves to Better Predict the Future

Benjamin Turtel, Danny Franklin, Philipp Schoenegger

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19266 2025-02-03 cs.AI cs.LG econ.TH 79%

Jackpot! Alignment as a Maximal Lottery

Roberto-Rafael Maura-Rivero, Marc Lanctot, Francesco Visin, Kate Larson

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14912 2025-01-28 cs.LG cs.AI 79%

Feasible Learning

Juan Ramirez, Ignacio Hounie, Juan Elenter, Jose Gallego-Posada, Meraj Hashemizadeh, Alejandro Ribeiro, Simon Lacoste-Julien

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Comments Published at AISTATS 2025. Code available at https://github.com/juan43ramirez/feasible-learning

详情

展开后加载摘要…

URL PDF HTML 收藏