arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2602.00931 2026-04-24 cs.LG cs.AI 86%

Continuous-Utility Direct Preference Optimization

连续效用直接偏好优化

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zihao He, Muhammad Usman Rafique, Asad Aali, Muhammad Ali Jamshed, John M. Cioffi, Emily Fox

机构 * stanford(斯坦福大学) meta glasgow(格拉斯哥大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12817 2026-04-23 cs.CL cs.AI cs.CY 86%

From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP

从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异

Shanshan Xu, Santosh T. Y. S. S, Barbara Plank

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) Amazon(亚马逊) LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09373 2026-04-22 cs.LG cs.AI cs.CV 86%

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

LPO:通过位置偏好优化实现更准确的GUI代理交互

Jiaqi Tang, Yu Xia, Yi-Feng Wu, Yuwei Hu, Yuhui Chen, Qing-Guo Chen, Xiaogang Xu, Xiangyu Wu, Hao Lu, Yanqing Ma, Shiyin Lu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出LPO方法,通过位置偏好优化提升GUI交互精度,利用信息熵预测交互位置并引入动态位置奖励函数,实验表明其在离线和在线评估中均取得最佳性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18731 2026-04-21 cs.CL cs.AI 86%

One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment

一个适应任何:面向个性化大语言模型对齐的元奖励建模

Hongru Cai, Yongqi Li, Tiezheng Yu, Fengbin Zhu, Wenjie Wang, Fuli Feng, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出元奖励建模(MRM)方法,通过元学习框架优化奖励模型初始化,提升个性化对齐的效率与鲁棒性,实验表明其在少样本场景下表现优异。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10996 2026-04-14 cs.CL cs.AI cs.CE 86%

When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies

当有效信号失效时:LLM特征与强化学习交易策略之间的制度边界

Zhengzhe Yang

机构 * Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM生成连续数值特征是否能提升强化学习交易代理性能,发现有效特征在分布偏移时会引入噪声,影响策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03179 2026-04-06 cs.LG cs.AI cs.CV 86%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08777 2026-03-30 cs.CL cs.AI 86%

Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages

流畅对齐与不流畅评判:低资源语言的后训练方法

David Samuel, Lilja Øvrelid, Erik Velldal, Andrey Kutuzov

机构 * Language Technology Group, University of Oslo(奥斯陆大学语言技术组)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种低资源语言的后训练方法,通过不流畅评判模型保持语言模型的流畅性,通过挪威语案例研究验证了基于策略的训练方法在无需额外数据时的有效性。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI 86%

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16897 2026-03-19 eess.SP cs.CL cs.HC cs.LG q-bio.NC 86%

EEG-Based Brain-LLM Interface for Human Preference Aligned Generation

基于EEG的脑-大语言模型接口用于人类偏好对齐生成

Junzi Zhang, Jianing Shen, Weijie Tu, Yi Zhang, Hailin Zhang, Tom Gedeon, Bin Jiang, Yue Yao

机构 * Shandong University, China(山东大学) Australian National University, Australia(澳大利亚国立大学) Curtin University, Australia(Curtin大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于EEG的脑-大语言模型接口,通过EEG信号引导图像生成模型,利用神经信号反馈实现模型动态适应,为适应性语言模型推理提供新思路。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06743 2026-03-10 cs.LG cs.AI 86%

Stabilizing Reinforcement Learning for Diffusion Language Models

稳定扩散语言模型的强化学习

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang, Jiacheng Sun, Qiang Xu

机构 * Huawei Foundation Model Department(华为基础模型部门) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StableDRL方法,针对扩散语言模型中的强化学习问题,通过无条件裁剪和自我归一化解决比率估计噪声导致的不稳定性,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20065 2026-03-05 cs.LG cs.AI 86%

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性

Geon-Hyeong Kim, Yu Jin Kim, Byoungjip Kim, Honglak Lee, Kyunghoon Bae, Youngsoo Jang, Moontae Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。

Comments 40 pages

Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03324 2026-03-05 cs.CL cs.AI 86%

Controlling Chat Style in Language Models via Single-Direction Editing

通过单向编辑控制语言模型的聊天风格

Zhenyu Xu, Victor S. Sheng

机构 * Department of Computer Science, Texas Tech University(计算机科学系,德克萨斯科技大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过单向编辑实现语言模型风格控制,通过线性方向编码实现精准风格调整,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 86%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 86%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22146 2026-02-26 cs.LG cs.AI 86%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 86%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15854 2026-02-23 cs.CL cs.AI 86%

Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization

通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行

Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You

机构 * School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国) College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GOPO框架,通过解耦策略规划与响应生成,提升任务导向对话系统的长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11902 2026-02-13 cs.LG cs.AI 86%

Mitigating Mismatch within Reference-based Preference Optimization

缓解基于参考的偏好优化中的不匹配

Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) CFAR, A*STAR(CFAR,A*STAR) CSIRO, Data61(CSIRO,Data61) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HyPO通过有条件地去偏参考信号缓解基于参考的偏好优化中的不匹配问题,提升推理对齐性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06411 2026-01-30 cs.AI cs.LG 86%

SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization

SofT-GRPO:通过Gumbel-重新参数化软思考策略优化超越离散标记LLM强化学习

Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) School of Intelligence Science(智能科学学院) Technology, Nanjing University, China(技术学院,南京大学,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SofT-GRPO通过引入Gumbel噪声和重新参数化技巧,在软思考模式下提升LLM推理性能,使其在Pass@1和Pass@32任务中分别优于离散标记GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 86%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18306 2026-01-27 cs.CL cs.AI 86%

Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM

超越英语的校准:为更好的量化多语言大语言模型的语言多样性

Everlyn Asiko Chimoto, Mostafa Elhoushi, Bruce A. Bassett

机构 * Lelapa AI Cerebras Systems, Inc University of the Witwatersrand(乌得勒支大学) University of Cape Town(开普敦大学) South African Astronomical Observatory(南非天文台)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过多语言校准集提升多语言大语言模型的量化性能,发现非英语和多语言混合校准显著降低困惑度,强调语言对齐的重要性。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14686 2026-01-22 cs.AI cs.LG 86%

IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization

IB-GRPO: 通过基于指标的群体相对策略优化对基于大语言模型的学习路径推荐进行对齐

Shuai Wang, Yaoming Yang, Bingdong Li, Hao Hao, Aimin Zhou

机构 * East China Normal University(东华大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IB-GRPO通过基于指标的群体相对策略优化,解决大语言模型在学习路径推荐中的多目标对齐问题,提升学习效果与教学目标的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11379 2026-01-19 cs.CL cs.AI cs.CY cs.SI 86%

Evaluating LLM Behavior in Hiring: Implicit Weights, Fairness Across Groups, and Alignment with Human Preferences

评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性

Morgane Hoffmann, Emma Jouffroy, Warren Jouanneau, Marc Palyart, Charles Pebereau

机构 * Malt

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07593 2026-01-13 cs.AR cs.CL cs.LG 86%

GRPO with State Mutations: Improving LLM-Based Hardware Test Plan Generation

GRPO与状态突变:改进基于LLM的硬件测试计划生成

Dimple Vijay Kochar, Nathaniel Pinckney, Guan-Ting Liu, Chia-Tung Ho, Chenhui Deng, Haoxing Ren, Brucek Khailany

机构 * Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院电子工程与计算机科学系) NVIDIA Research, Austin, TX(NVIDIA研究部) NVIDIA Research, Taiwan(NVIDIA台湾研究部) NVIDIA Research, Santa Clara, CA(NVIDIA圣克拉拉研究部)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 GRPO-SMu通过改进LLM训练方法,显著提升硬件验证中测试计划生成的准确率和突变检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 86%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00162 2025-12-25 cs.CL cs.AI 86%

Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback

序列到序列奖励建模:通过语言反馈改进RLHF

Jiayi Zhou, Jiaming Ji, Juntao Dai, Dong Li, Yaodong Yang

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 86%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10040 2025-12-12 cs.LG cs.AI stat.ML 86%

Intelligently Weighting Multiple Reference Models for Direct Preference Optimization of LLMs

智能加权多个参考模型以直接优化大语言模型的偏好

Skyler Wu, Aymen Echarghaoui

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种新的加权策略以优化大语言模型的偏好,发现单参考DPO在多数情况下优于多参考方法。

Comments Working paper. 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07611 2025-12-09 cs.AI cs.LG 86%

Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement

PPO、GRPO和DAPO在LLM推理增强中的比较分析与参数调优

Yongsheng Lian

机构 * Mechanical Engineering Department University of Louisville(路易斯维尔大学机械工程系)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较PPO、GRPO和DAPO在LLM推理增强中的表现,发现GRPO和DAPO在参数调优下具有更稳定的训练动态和更高的准确性,而DAPO禁用动态采样时表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16690 2025-11-26 cs.LG cs.AI 86%

Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator

你的预训练大语言模型实际上是一个未监督的置信度校准器

Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DACA方法,通过无监督方式优化后训练模型的置信度校准,减少不一致预测带来的过度自信问题,提升模型可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏