arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2406.09215 2024-11-08 cs.IR cs.AI 83%

On Softmax Direct Preference Optimization for Recommendation

Yuxin Chen, Junfei Tan, An Zhang, Zhengyi Yang, Leheng Sheng, Enzhi Zhang, Xiang Wang, Tat-Seng Chua

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17055 2024-10-24 cs.LG stat.ML 83%

Optimal Design for Reward Modeling in RLHF

Antoine Scheid, Etienne Boursier, Alain Durmus, Michael I. Jordan, Pierre Ménard, Eric Moulines, Michal Valko

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00279 2024-10-24 cs.CL 83%

Let Me Teach You: Pedagogical Foundations of Feedback for Language Models

Beatriz Borges, Niket Tandon, Tanja Käser, Antoine Bosselut

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments EMNLP 2024; 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17389 2024-10-24 cs.AI 83%

Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models

Muhan Lin, Shuyang Shi, Yue Guo, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi Pari, Simon Stepputtis, Joseph Campbell, Katia Sycara

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments 13 pages, 8 figures, The 2024 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16184 2024-10-22 cs.CL 83%

RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style

Yantao Liu, Zijun Yao, Rui Min, Yixin Cao, Lei Hou, Juanzi Li

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16027 2024-10-22 cs.CL 83%

ComPO: Community Preferences for Language Model Personalization

Sachin Kumar, Chan Young Park, Yulia Tsvetkov, Noah A. Smith, Hannaneh Hajishirzi

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12194 2024-10-17 cs.CL 83%

Negative-Prompt-driven Alignment for Generative Language Model

Shiqi Qiao, Ning Xv, Biao Liu, Xin Geng

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12163 2024-10-07 cs.CL 83%

Preference-Guided Reflective Sampling for Aligning Language Models

Hai Ye, Hwee Tou Ng

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments EMNLP2024, main

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15630 2024-08-29 cs.SE cs.AI 83%

CodeSift: An LLM-Based Reference-Less Framework for Automatic Code Validation

Pooja Aggarwal, Oishik Chatterjee, Ting Dai, Prateeti Mohapatra, Brent Paulovicks, Brad Blancett, Arthur De Magalhaes

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12358 2024-08-14 cs.LG 83%

From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function

Rafael Rafailov, Joey Hejna, Ryan Park, Chelsea Finn

专题命中 后训练与偏好优化 :language model(title);RLHF(abstract);preference optimization(abstract);分类 cs.LG

Comments COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00215 2024-07-02 cs.SE cs.LG 83%

LLM Critics Help Catch LLM Bugs

Nat McAleese, Rai Michael Pokorny, Juan Felipe Ceron Uribe, Evgenia Nitishinskaya, Maja Trebacz, Jan Leike

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07168 2024-06-12 cs.CL 83%

Teaching Language Models to Self-Improve by Learning from Language Feedback

Chi Hu, Yimin Hu, Hang Cao, Tong Xiao, Jingbo Zhu

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14688 2024-06-04 cs.LG 83%

Q-Probe: A Lightweight Approach to Reward Maximization for Language Models

Kenneth Li, Samy Jelassi, Hugh Zhang, Sham Kakade, Martin Wattenberg, David Brandfonbrener

专题命中 后训练与偏好优化 :language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14718 2024-04-23 cs.CL 83%

Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models

Ashutosh Baheti, Ximing Lu, Faeze Brahman, Ronan Le Bras, Maarten Sap, Mark Riedl

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL

Comments published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09824 2024-04-16 cs.CL 83%

Impact of Preference Noise on the Alignment Performance of Generative Language Models

Yang Gao, Dana Alon, Donald Metzler

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07551 2023-12-14 cs.CL 83%

Language Model Alignment with Elastic Reset

Michael Noukhovitch, Samuel Lavoie, Florian Strub, Aaron Courville

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL

Comments Published at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01693 2023-10-31 cs.CL 83%

Fine-Grained Human Feedback Gives Better Rewards for Language Model Training

Zeqiu Wu, Yushi Hu, Weijia Shi, Nouha Dziri, Alane Suhr, Prithviraj Ammanabrolu, Noah A. Smith, Mari Ostendorf, Hannaneh Hajishirzi

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL

Comments NeurIPS 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16681 2023-10-26 cs.CL 83%

BabyStories: Can Reinforcement Learning Teach Baby Language Models to Write Better Stories?

Xingmeng Zhao, Tongnian Wang, Sheri Osborn, Anthony Rios

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL

Comments Accepted to BabyLM workshop at CoNLL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13498 2022-04-29 cs.CL 83%

Post-Training Dialogue Summarization using Pseudo-Paraphrasing

Qi Jia, Yizhu Liu, Haifeng Tang, Kenny Q. Zhu

专题命中 后训练与偏好优化 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.02327 2021-06-07 cs.CL 83%

Bi-Granularity Contrastive Learning for Post-Training in Few-Shot Scene

Ruikun Luo, Guanhuan Huang, Xiaojun Quan

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02232 2019-05-07 cs.CL 83%

BERT Post-Training for Review Reading Comprehension and Aspect-based Sentiment Analysis

Hu Xu, Bing Liu, Lei Shu, Philip S. Yu

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL

Comments accepted by NAACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18531 2026-08-20 cs.AI cs.LG 新提交 82%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 82%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17299 2026-08-14 cs.CL cs.AI 版本更新 82%

Cat-DPO: Category-Adaptive Safety Alignment

Cat-DPO:基于类别的安全对齐

Tiankai Yang, Yi Nian, Xinyuan Li, Ruiyao Xu, Henry Peng Zou, Kaize Ding, Xiyang Hu, Yan Liu, Yue Zhao

机构 * University of Southern California(南加州大学) Northwestern University(西北大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Cat-DPO通过将安全对齐转化为类别约束优化问题,为每个有害类别设置独立的适应性安全边际,提升整体帮助性和无害性,减少类别间的安全方差和最佳至最差差距。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19395 2026-07-23 cs.LG cs.AI 新提交 82%

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation

从轨迹到前缀:通过重放前缀和在线延续复用教师轨迹

Yihan Wang, Zhong Guan, Haoran Sun, Jiale Huang, Likang Wu, Hongke Zhao

机构 * Tianjin University(天津大学) Peking University(北京大学) Tianjin University of Technology(天津工业大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型蒸馏低效问题,提出Prefix-GRPO强化学习框架,将教师轨迹分解,通过重放前缀恢复中间状态并在线延续,统一前缀与延续学习,实验证明其优于蒸馏和标准RL基线,凸显前缀令牌优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 82%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07993 2026-07-10 cs.CL cs.LG 新提交 82%

Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

幻觉自我博弈:通过进化生成器引导强化检测器

Shiping Yang, Shining Liang, Weihao Liu, Wenbiao Ding, Linjun Shou, Lu Cheng, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Microsoft(微软) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对高质量标注数据稀缺致识别LLM生成输出中幻觉困难及现有方法局限,提出幻觉自我博弈框架,含检测器和生成器,经多轮训练优化,能在无外部监督下提升小型LLM性能。

Comments Accepted to COLM 2026. Camera-ready version to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 82%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 82%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00531 2026-07-02 cs.LG cs.AI q-bio.BM stat.ML 新提交 82%

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏