arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2601.15160 2026-03-09 cs.AI cs.CL 79%

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

知识图谱是隐式奖励模型:路径衍生信号促进组合推理

Yuval Kansal, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University, New Jersey, USA(电气与计算机工程系,普林斯顿大学,新泽西州,美国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用知识图谱作为隐式奖励模型,通过路径衍生信号提升模型在复杂推理任务中的组合推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 79%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00499 2026-02-17 cs.LG cs.AI stat.ML 79%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 79%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 79%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI 79%

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01879 2026-02-11 cs.CL cs.AI 79%

REPAIR: Robust Editing via Progressive Adaptive Intervention and Reintegration

通过渐进自适应干预与再整合实现鲁棒编辑

Yisu Wang, Ming Wang, Haoyuan Song, Wenjie Huang, Chaozheng Wang, Yi Xie, Xuming Ran

机构 * Engineering Center for Space Utilization of Chinese Academy of Sciences(中国科学院空间利用工程技术中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science and Engineering(计算机科学与工程学院) Northeastern University(东北大学) New York University(纽约大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 REPAIR通过闭环反馈和动态内存管理实现鲁棒编辑,提升编辑准确性并减少知识遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI 79%

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06049 2026-02-09 cs.CL cs.AI 79%

Recontextualizing Famous Quotes for Brand Slogan Generation

重新上下文化著名引语以生成品牌标语

Ziao Yang, Zizhang Chen, Lei Zhang, Hongfu Liu

机构 * Brandeis University(布兰迪斯大学) Adobe(Adobe公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过重新上下文化著名引语生成新颖且具人设的标语,采用模块化框架提升标语的多样性与情感影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04349 2026-02-06 cs.CL cs.AI 79%

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

GTPO和GRPO-S:基于策略熵的token和序列级奖励塑造

Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTPO和GRPO-S两种算法,通过引入熵权机制实现token和序列级的细粒度奖励塑造,提升大型语言模型在长链推理任务中的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04912 2026-02-06 cs.IR cs.CL cs.LG 79%

Atomic Information Flow: A Network Flow Model for Tool Attributions in RAG Systems

原子信息流:一种用于RAG系统工具归因的网络流模型

James Gao, Josh Zhou, Qi Sun, Ryan Huang, Steven Yoo

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 原子信息流通过分解工具输出和LLM调用为原子单元,提升RAG系统中工具归因的准确性和上下文压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03025 2026-02-04 cs.AI cs.CL 79%

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

RC-GRPO:基于奖励的组相对策略优化用于多轮工具调用智能体

Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所,中国科学院) School of Mathematics and Statistics(数学与统计学学院) Statistics, Lanzhou University(统计学,兰州大学) Shanghai Innovation Institute(上海创新研究院) Microsoft Research(微软研究院) Nanjing University(南京大学) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 RC-GRPO通过奖励条件化策略优化提升多轮工具调用性能,有效解决组内奖励稀疏导致的更新问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02341 2026-02-03 cs.CL cs.AI 79%

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT:从现实世界偏好学习中学习大量用户不满

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过利用现实世界中的用户不满信号,提升大语言模型的偏好学习性能,实现更高的任务得分和胜率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22338 2026-01-28 cs.CL cs.AI 79%

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad:从自然语言反馈中强化学习

Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。

Comments The code for our method is available at https://github.com/microsoft/Text2Grad

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17217 2026-01-15 cs.CL cs.AI cs.CY 79%

Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs

通过促进大语言模型的探索性思维来缓解性别偏见

Kangda Wei, Hasnat Md Abdullah, Ruihong Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 通过生成性别中性故事对并利用直接偏好优化,该研究旨在减少大语言模型中的性别偏见,同时保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21830 2026-01-09 cs.LG cs.AI 79%

GAPO: Robust Advantage Estimation for Real-World Code LLMs

GAPO:面向现实世界代码LLM的鲁棒优势估计

Jianqing Zhang, Zhezheng Hao, Wei Xia, Hande Dong, Hong Wang, Chenxing Wei, Yuyan Zhou, Yubin Qi, Qiang Lin, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Zhejiang University(浙江大学) Shenzhen University(深圳大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 79%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06065 2026-01-06 cs.AI cs.CL 79%

ScRPO: From Errors to Insights

ScRPO:从错误到洞察

Lianrui Li, Dakuan Lu, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 ScRPO通过自我反思和错误纠正机制,提升大语言模型的数学推理能力,在多个基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12867 2025-12-25 cs.AI cs.LG 79%

Bootstrapping LLMs via Preference-Based Policy Optimization

通过基于偏好的策略优化提升大语言模型

Chen Jia

机构 * Chen Jia(陈佳)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好的策略优化框架,通过主动收集偏好数据实现大语言模型的持续改进,并在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22219 2025-12-22 cs.CL cs.AI 79%

RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation

从教师模型细化进行强化学习:机器翻译中的渐进模仿学习

Dongyub Jude Lee, Zhenyi Ye, Pengcheng He

机构 * Zoom Communications(Zoom公司)

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLfR方法,通过教师模型细化和复合奖励机制提升机器翻译的语义质量和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15353 2025-12-18 cs.CL cs.AI 79%

Adversarial versification in portuguese as a jailbreak operator in LLMs

葡萄牙对抗性韵律作为LLMs中的对抗性操作符

Joao Queiroz

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,将提示改写为诗歌能显著提高LLMs的安全漏洞,揭示当前对齐机制的不足,并指出葡萄牙语评估的缺失。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 79%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23229 2025-11-19 cs.CL cs.AI cs.CY 79%

MCTSr-Zero: Self-Reflective Psychological Counseling Dialogues Generation via Principles and Adaptive Exploration

Hao Lu, Yanchi Gu, Haoyuan Huang, Yulin Zhou, Ningxin Zhu, Chen Li

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 48 pages, 3 figures. Accepted in AAAI-2026 (Main Technical Track). For code and model, see this https://github.com/JianChengXingYun/Mctsr-Zero

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03262 2025-11-11 cs.CL cs.LG 79%

REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Jian Hu, Jason Klein Liu, Haotian Xu, Wei Shen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments refactor

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06915 2025-11-05 cs.CL cs.AI 79%

LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling

Zecheng Tang, Baibei Ji, Quantong Qiu, Haitian Wang, Xiaobo Liang, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学) LCM Laboratory(LCM实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01807 2025-11-04 cs.CL cs.AI 79%

Plan-and-Write: Structure-Guided Length Control for LLMs without Model Retraining

Adewale Akinfaderin, Shreyas Subramanian, Akarsha Sehwag

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Presented at Workshop on Prompt Optimization, KDD 2025, Toronto, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04251 2025-11-04 cs.AI cs.LG cs.MA 79%

Language-Driven Coordination and Learning in Multi-Agent Simulation Environments

Zhengyang Li, Sawyer Campos, Nana Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01369 2025-10-31 cs.LG cs.AI 79%

Incentivizing LLMs to Self-Verify Their Answers

Fuxiang Zhang, Jiacheng Xu, Chaojie Wang, Ce Cui, Yang Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Skywork AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19158 2025-10-28 cs.CL cs.AI 79%

When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning

Yijiang River Dong, Tiancheng Hu, Yinhong Liu, Ahmet Üstün, Nigel Collier

机构 * University of Cambridge(剑桥大学) Cohere For AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12961 2025-10-24 cs.LG cs.AI physics.chem-ph q-bio.QM 79%

Aligning Transformers with Continuous Feedback via Energy Rank Alignment

Shriram Chennakesavalu, Frank Hu, Sebastian Ibarraran, Grant M. Rotskoff

机构 * Department of Chemistry Stanford University(化学系 斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏