arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4489 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4489 篇

2606.26787 2026-06-26 cs.LG cs.AI cs.CL 新提交 91%

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

AIGP:基于LLM的电商定价长期价值对齐框架

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。

Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01127 2026-06-24 cs.CR 版本更新 91%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19102 2026-05-20 cs.SE 91%

Prompt Optimization for LLM Code Generation via Reinforcement Learning

通过强化学习优化LLM代码生成的提示

Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22504 2026-04-27 cs.IR 91%

Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders

通过硬负样本进行目标塑造:基于RL的LLM推荐系统中的窗口化部分AUC优化

Wentao Shi, Qifan Wang, Chen Chen, Fei Liu, Dongfang Liu, Xu Liu, Wanli Ma, Junfeng Pan, Linhong Zhu, Fuli Feng

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出窗口化部分AUC优化方法,通过约束假阳性率提升与Top-K指标的一致性,改进基于RL的LLM推荐系统性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20705 2026-04-23 cs.CV 91%

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

SSL-R1: 多模态大语言模型的自监督视觉强化后训练

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract)

AI总结 SSL-R1通过自监督学习生成可验证奖励,提升多模态大语言模型的推理能力,无需人工或外部监督,有效增强视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09055 2025-09-12 cs.CL cs.AI cs.LG 91%

Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M

Piyush Pant

机构 * Saarland University(萨尔兰大学)

专题命中 后训练与偏好优化 :SFT(title,abstract);LLM(title,comments);language model(abstract);RLHF(abstract)

Comments 17 pages, 3 figures. Code and dataset available at https://github.com/PiyushWithPant/Improving-LLM-Safety-and-Helpfulness-using-SFT-and-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19326 2025-07-01 cs.CV 91%

Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment

Ziang Yan, Zhilin Li, Yinan He, Chenting Wang, Kunchang Li, Xinhao Li, Xiangyu Zeng, Zilei Wang, Yali Wang, Yu Qiao, Limin Wang, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract)

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00441 2025-06-03 cs.IR 91%

K-order Ranking Preference Optimization for Large Language Models

Shihao Cai, Chongming Gao, Yang Zhang, Wentao Shi, Jizhi Zhang, Keqin Bao, Qifan Wang, Fuli Feng

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23825 2026-05-25 cs.LG cs.AI 91%

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

是人类,而非数据:LLM中的地缘政治偏见源于后训练,并通过提示语言放大

Stuart Bladon, Brinnae Bent

机构 * Alibaba(阿里巴巴) seven AI labs(七家人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract);post-training(title,abstract);language model(abstract);prompting(abstract)

AI总结 研究发现大语言模型的地缘政治偏见主要源于后训练阶段而非预训练,且偏见方向与模型开发者所在国一致,提示语言会放大该偏见。

Comments 12 pages, 6 figures, 2 tables, 3 appendices. Code and scenario bank: https://github.com/recozers/LLM-Bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27273 2026-07-31 cs.LG 新提交 91%

SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

SDO:面向高效大语言模型后训练的结构感知数据组织

Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对大语言模型后训练中数据组织固定导致的样本优化失衡问题,提出SDO框架,通过逐轮调整小批量与样本暴露,加快多任务收敛并均衡不同问题类型的准确率。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19367 2026-07-23 cs.AI 新提交 91%

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(title);language model(title);LLM(abstract)

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05441 2026-07-08 cs.IR cs.AI 新提交 91%

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02327 2026-07-03 cs.CL 版本更新 91%

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习

Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) Huawei Technologies Co., Ltd(华为技术有限公司) Seed, ByteDance Inc.(字节跳动公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title);language model(title);preference optimization(abstract)

AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。

Comments Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19607 2026-06-19 cs.AI stat.AP 新提交 91%

Which Pairs to Compare for LLM Post-Training?

LLM后训练中应比较哪些对?

Jiangze Han, Vineet Goyal, Will Ma

机构 * Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);language model(abstract);preference optimization(abstract)

AI总结 研究偏好后训练中如何选择最具信息量的比较对,提出基于采样设计的比较策展方法,通过DPO训练的理论分析给出优化准则,实验证明能提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 91%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09629 2026-05-29 cs.CL 91%

HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation

HumorGen: 基于角色蒸馏的大语言模型幽默生成的认知协同

Edward Ajayi, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);preference optimization(abstract)

AI总结 针对大语言模型标准训练目标与幽默所需意外性之间的矛盾,提出认知协同框架,利用六种认知角色合成多样化喜剧视角数据,微调7B参数学生模型,实验表明认知驱动的数据策展比对齐算法或模型规模更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09853 2026-05-12 cs.LG 91%

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

基于探索的优化用于测试时大语言模型推理

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16279 2026-04-20 cs.LG physics.chem-ph 91%

Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design

评估大型语言模型在小分子药物设计中的进展

Shriram Chennakesavalu, Kirill Shmilovich, Hayley Weir, Colin Grambow, John Bradshaw, Patricia Suriana, Chen Cheng, Kangway Chuang

机构 * Prescient Design Genentech(基因泰克) South San Francisco, CA, USA(旧金山南区,加利福尼亚州,美国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);post-training(abstract)

AI总结 本文通过设计化学基础任务评估LLM在药物设计中的能力,发现前沿模型在化学任务中表现提升,但实验场景下仍有改进空间,RL后训练显著提升性能,小型模型经训练后可与前沿模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15789 2026-04-20 cs.CL 91%

A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

对可信大语言模型无训练方法的系统研究

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文系统评估了无训练方法在不同可信设置下的有效性,分析了其对效用、鲁棒性和计算开销的影响,并提出平衡可信性、效用和鲁棒性的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14041 2026-03-17 cs.AI 91%

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

GRPO与反思奖励在大语言模型数学推理中的应用

Zhijie Wang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。

Journal ref Applied and Computational Engineering 154 161-166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06874 2025-12-09 cs.CL 91%

An Analysis of Large Language Models for Simulating User Responses in Surveys

大型语言模型在模拟调查用户响应中的分析

Ziyun Yu, Yiru Zhou, Chen Zhao, Hongyi Wen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06652 2025-10-09 cs.CL 91%

Aligning Large Language Models via Fully Self-Synthetic Data

Shangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng

机构 * University of California, Riverside(加州大学河滨分校) University of Virginia(弗吉尼亚大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18439 2025-07-15 cs.AI 91%

MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning

Chanwoo Park, Seungju Han, Xingzhi Guo, Asuman Ozdaglar, Kaiqing Zhang, Joo-Kyung Kim

机构 * MIT(麻省理工学院) Stanford(斯坦福大学) Amazon(亚马逊) UMD(大学公园大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments version for ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18245 2025-06-24 cs.CR cs.AI cs.SE 91%

Smart-LLaMA-DPO: Reinforced Large Language Model for Explainable Smart Contract Vulnerability Detection

Lei Yu, Zhirong Huang, Hang Yuan, Shiqi Cheng, Li Yang, Fengjun Zhang, Chenjie Shen, Jiajia Ma, Jingyuan Zhang, Junyi Lu, Chun Zuo

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Sinosoft Company Limited(软通公司)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments Accepted to ISSTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24199 2025-06-02 cs.CL 91%

Intuitionistic Fuzzy Sets for Large Language Model Data Annotation: A Novel Approach to Side-by-Side Preference Labeling

Yimin Du

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23108 2025-05-30 cs.CL 91%

Generating Diverse Training Samples for Relation Extraction with Large Language Models

Zexuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(人工智能学院,南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(脑机智能技术重点实验室,教育部)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17956 2025-05-27 cs.AI 91%

Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier

Anirudhan Badrinath, Prabhat Agarwal, Jiajing Xu

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17122 2025-05-26 cs.CL 91%

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?

Xuan Qi, Jiahao Qiu, Xinzhe Juan, Yue Wu, Mengdi Wang

机构 * IIIS, Tsinghua University(清华大学信息学院) AI Lab, Princeton University(普林斯顿大学人工智能实验室) Department of Computer Science & Engineering, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16714 2025-04-22 cs.CL 91%

Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment

Mingzhi Wang, Chengdong Ma, Qizhi Chen, Linjian Meng, Yang Han, Jiancong Xiao, Zhaowei Zhang, Jing Huo, Weijie J. Su, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) China Telecom(中国电信) University of Pennsylvania(宾夕法尼亚大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);LLM(abstract);large language model(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18890 2024-10-25 cs.AI 91%

Improving Small-Scale Large Language Models Function Calling for Reasoning Tasks

Graziano A. Manduzio, Federico A. Galatolo, Mario G. C. A. Cimino, Enzo Pasquale Scilingo, Lorenzo Cominelli

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏