arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2511.16139 2025-12-05 cs.AI 77%

Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints

通过几何投影参考约束的多维评分导向奖励模型学习

Yongnan Jin, Xurui Li, Feng Cao, Liucun Gao, Juanjuan Yao

机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08123 2025-12-05 cs.CL 77%

QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA

QA-LIGN:通过宪法分解的问答对对齐大语言模型

Jacob Dineen, Aswin RRV, Qin Liu, Zhikun Xu, Xiao Ye, Ming Shen, Zhaonan Li, Shijie Lu, Chitta Baral, Muhao Chen, Ben Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 QA-LIGN通过分解奖励信号提升LLM对齐效果,降低攻击成功率并保持低拒绝率,实现安全与帮助性的帕累托最优。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 77%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17937 2025-11-25 cs.AI 77%

Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria

对齐欺骗 - 训练到部署的不对称性:通过博弈论视角的贝叶斯-斯克尔伯格均衡

Kartik Garg, Shourya Mishra, Kartikeya Sinha, Ojaswi Pratap Singh, Ayush Chopra, Kanishk Rai, Ammar Sheikh, Raghav Maheshwari, Aman Chadha, Vinija Jain, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa学院) Apple, USA(苹果公司) Google, USA(谷歌公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 通过博弈论视角研究AI对齐欺骗现象,分析不同偏好优化方法在安全、无害和有用性方面的表现,揭示其成因及发生条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15256 2025-11-20 cs.LG cs.CV 77%

GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning

Yanchen Xu, Ziheng Jiao, Hongyuan Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院(iOPEN),西北工业大学) HuaWei Technologies Co., Ltd.(华为技术有限公司) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13288 2025-11-19 cs.AI 77%

Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO

Haoyang Hong, Jiajun Yin, Yuan Wang, Jingnan Liu, Zhe Chen, Ailing Yu, Ji Li, Zhiling Ye, Hansong Xiao, Yefei Chen, Hualei Zhou, Yun Yue, Minghui Yang, Chunxiao Guo, Junwei Liu, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07419 2025-11-13 cs.LG 77%

Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs

Zhongyang Li, Ziyue Li, Tianyi Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20413 2025-10-24 cs.LG 77%

Why DPO is a Misspecified Estimator and How to Fix It

Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee

机构 * IISc Bangalore(班加罗尔IISc) IIT Kanpur(坎purIIT) HP AI Research(HP人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20022 2025-10-24 cs.LG 77%

SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph

Jiazheng Li, Yawei Wang, David Yan, Yijun Tian, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * University of Connecticut(康涅狄格大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18895 2025-10-23 cs.SE cs.AI cs.HC 77%

CosmoCore Affective Dream-Replay Reinforcement Learning for Code Generation

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10935 2025-10-22 cs.CL 77%

Introducing Spotlight: A Novel Approach for Generating Captivating Key Information from Documents

Ankan Mullick, Sombit Bose, Rounak Saha, Ayan Kumar Bhowmick, Aditya Vempaty, Prasenjit Dey, Ravi Kokku, Pawan Goyal, Niloy Ganguly

机构 * IIT Kharagpur(印度克达尔普大学) Emergence AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Paper accepted in EMNLP 2025 Main Conference (Full Paper)

Journal ref EMNLP 2025 Main Conference (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14942 2025-10-17 cs.AI 77%

GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning

Yao Zhang, Yu Wu, Haowei Zhang, Weiguo Li, Haokun Chen, Jingpei Wu, Guohao Li, Zhen Han, Volker Tresp

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13501 2025-10-16 cs.AI 77%

Confidence as a Reward: Transforming LLMs into Reward Models

He Du, Bowen Li, Chengxing Xie, Chang Gao, Kai Chen, Dacheng Tao

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26074 2025-10-15 cs.CL 77%

Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis

Leitian Tao, Xuefeng Du, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06870 2025-10-10 cs.CL 77%

$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences

Yining Wang, Jinman Zhao, Chuangxin Zhao, Shuhao Guan, Gerald Penn, Shinan Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19281 2025-10-07 cs.LG 77%

A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning

Yuzheng Hu, Fan Wu, Haotian Ye, David Forsyth, James Zou, Nan Jiang, Jiaqi W. Ma, Han Zhao

机构 * UIUC Urbana(伊利诺伊大学 Urbana分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02850 2025-10-06 cs.AI 77%

Reward Model Routing in Alignment

Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24375 2025-09-30 cs.CL 77%

Reinforcement Mid-Training

Yijun Tian, Shaoyu Chen, Zhichao Xu, Yawei Wang, Jinhe Bi, Peng Han, Wei Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19199 2025-09-30 cs.CL 77%

Agentic Reinforcement Learning with Implicit Step Rewards

Xiaoqian Liu, Ke Wang, Yuchuan Wu, Fei Huang, Yongbin Li, Junge Zhang, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab(通义实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20961 2025-09-26 cs.CV cs.AI 77%

Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos

Sarmistha Das, R E Zera Marveen Lyngkhoi, Sriparna Saha, Alka Maurya

机构 * Indian Institute of Technology Patna(印度帕纳杰大学) CRISIL LTD(CRISIL公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09852 2025-09-15 cs.CL 77%

Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization

Chuyuan Li, Austin Xu, Shafiq Joty, Giuseppe Carenini

机构 * Department of Computer Science, University of British Columbia(英属哥伦比亚大学计算机科学系) Salesforce AI Research(Salesforce人工智能研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02949 2025-09-09 cs.CL 77%

RADIANT: Retrieval AugmenteD entIty-context AligNmenT -- Introducing RAG-ability and Entity-Context Divergence

Vipula Rawte, Rajarshi Roy, Gurpreet Singh, Danush Khanna, Yaswanth Narsupalli, Basab Ghosh, Abhay Gupta, Argha Kamal Samanta, Aditya Shingote, Aadi Krishna Vikram, Vinija Jain, Aman Chadha, Amit Sheth, Amitava Das

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19532 2025-08-28 cs.CL 77%

Alignment with Fill-In-the-Middle for Enhancing Code Generation

Houxing Ren, Zimu Lu, Weikang Shi, Haotian Hou, Yunqiao Yang, Ke Wang, Aojun Zhou, Junting Pan, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(CUHK语音实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北航)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16315 2025-08-26 cs.LG 77%

OwkinZero: Accelerating Biological Discovery with AI

Nathan Bigaud, Vincent Cabeli, Meltem Gürel, Arthur Pignet, John Klein, Gilles Wainrib, Eric Durand

机构 * Owkin

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14951 2025-08-22 cs.CL 77%

Improving LLMs for Machine Translation Using Synthetic Preference Data

Dario Vajda, Domen Vreš, Marko Robnik-Šikonja

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Paper with individual presentation at LUHME workshop at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20282 2025-08-22 cs.CL 77%

One-shot Entropy Minimization

Zitian Gao, Lynx Chen, Haoming Luo, Joey Zhou, Bryan Dai

机构 * Ubiquant(乌比科特)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12165 2025-08-19 cs.AI 77%

RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards

Rohit Krishnan, Jon Evans

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09463 2025-08-14 cs.CL 77%

User-centric Subjective Leaderboard by Customizable Reward Modeling

Qi Jia, Xiujie Song, Zicheng Zhang, Yijin Guo, Kaiwei Zhang, Zijian Chen, Guangtao Zhai

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05434 2025-08-11 cs.LG 77%

Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling

Han Qi, Haochen Yang, Qiaosheng Zhang, Zhuoran Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17849 2025-07-25 cs.CL 77%

Dynamic and Generalizable Process Reward Modeling

Zhangyue Yin, Qiushi Sun, Zhiyuan Zeng, Qinyuan Cheng, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏