arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2604.02174 2026-04-03 cs.AI 86%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 86%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :language model(title);post-training(title);SFT(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17515 2025-07-24 cs.CV cs.CL 86%

URPO: A Unified Reward & Policy Optimization Framework for Large Language Models

Songshuo Lu, Hua Wang, Zhi Chen, Yaohua Tang

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09269 2025-04-22 cs.SD cs.LG eess.AS 86%

Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs

Anshuman Sinha, Camille Migozzi, Aubin Rey, Chao Zhang

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title);分类 cs.LG

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06260 2025-03-11 cs.CV cs.AI 86%

From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models

Muzhi Dai, Jiashuo Sun, Zhiyuan Zhao, Shixuan Liu, Rui Li, Junyu Gao, Xuelong Li

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19759 2024-10-10 cs.CL 86%

Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment

Orgest Xhelili, Yihong Liu, Hinrich Schütze

专题命中 后训练与偏好优化 :language model(title);post-training(title);pretraining(abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04056 2026-08-06 cs.CL cs.CY cs.LG 新提交 86%

Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

基于多智能体视角偏好优化的性别歧视检测学习

Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对性别歧视检测中标注分歧问题,提出MAP-PO框架,通过聚类标注者并训练对应智能体,结合个体与团队奖励协调智能体,实验验证了聚类训练及团队信号的必要性。

Comments 17 pages, 12 figures, 14 tables. Preprint; under review at EACL 2027 (ACL Rolling Review, August 2026 cycle). Code and data: https://github.com/mohammadi-hadi/MAP-PO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新 86%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18239 2026-07-24 cs.LG cs.AI 版本更新 86%

Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

朝着解耦偏好优化动态:压制失败者,保留胜利者

Wei Chen, Yubing Wu, Junmei Yang, Delu Zeng, Qibin Zhao, John Paisley, Min Chen, Zhou Wang

机构 * South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。

Journal ref International Conference on Machine Learning(ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 86%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 86%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交 86%

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 86%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19004 2026-06-18 cs.DC cs.AI cs.LG 新提交 86%

Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

Spotlight: 协同种子探索与抢占式GPU用于DiT强化学习后训练

Ruiqi Lai, Dakai An, Wei Gao, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Dmitrii Ustiugov, Wei Wang

机构 * NTU Singapore(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对DiT强化学习后训练成本高的问题,提出Spotlight系统,通过利用探索对旧权重的容忍性和SP组快速重配置,在抢占式GPU上实现高效训练,加速4倍并降低成本1.4-6.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12881 2026-06-15 cs.CL cs.LG 新提交 86%

Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study

面向聊天机器人微调的直接偏好优化:一项实证研究

Dezhi Yu, Yvonne Qiu, ShuoJia Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。

Comments 7 pages, 3 figures, 1 table. All authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10890 2026-06-10 cs.LG cs.AI 新提交 86%

Optimal Post-Training Quantization Scales and Where to Find Them

最优后训练量化尺度及其寻找方法

Juan Amboage, Pablo Monteagudo-Lago, Ian Colbert, Giuseppe Franco, Nicholas Fraser

机构 * AMD

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PiSO算法,利用校准数据精确高效地计算逐通道最优量化尺度,并扩展到分组量化,在Llama和Qwen模型上显著提升困惑度和零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08496 2026-06-09 cs.CL cs.LG 新提交 86%

SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

SAEExplainer: 基于激活引导偏好优化的SAE特征解释

Jingyi He, Haiyan Zhao, Ruxue Shi, Yanguang Liu, Xin Wang, Fei Sun, Mengnan Du

机构 * Shanghai Jiao Tong University(上海交通大学) NJIT(新泽西理工学院) Jilin University(吉林大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SAEExplainer框架,利用激活分数作为奖励信号,通过两轮优化迭代自纠正基础解释,减少解释幻觉并增强因果触发模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05606 2026-06-05 cs.LG cs.AI math.OC 86%

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

跨时代自适应展开优化用于强化学习后训练

Yiming Zong, Yige Wang, Jiashuo Jiang

机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对提示词训练信号差异大的问题,提出CERO方法,通过贝叶斯估计提示词成功概率并利用Fenchel对偶优化自适应分配展开预算,在固定总预算下提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00395 2026-06-03 cs.LG cs.AI 86%

PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

PR2: 基于MoE的大语言模型强化学习中的预测性路由重放

Daize Dong, Junlin Chen, Haolong Jia, Jiang Liu, Jiawei Wu, Huanwei Di, Jialian Wu, Zhengzhong Liu, Zicheng Liu, Emad Barsoum, Dimitris N. Metaxas, Hongyi Wang

机构 * Rutgers University(罗格斯大学) AMD MBZUAI

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI 86%

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29888 2026-05-29 cs.LG cs.AI 86%

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

LaRA: 面向RL后训练中数据污染的逐层表示分析

Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LaRA框架,通过逐层表示分析检测强化学习后训练中的污染数据,利用扰动敏感性、方向坍缩和局部表示刚性三个指标,优于现有输出级方法。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28440 2026-05-28 cs.CL cs.LG 86%

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates

AdaDPO:具有平衡梯度更新的自适应直接偏好优化

Shaolong Chen, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(Incept实验室)

专题命中 后训练与偏好优化 :preference optimization(title);RLHF(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 针对DPO中梯度不对称导致模型偏向避免不良回答而非生成优质回答的问题,提出AdaDPO算法,通过引入基于策略模型生成概率的自适应系数来平衡正负偏好梯度,在AlpacaEval 2上优于DPO并缓解长度偏差。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26606 2026-05-27 cs.LG cs.AI 86%

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

将你的展开用在关键处:基于组强化学习后训练的展开分配

Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

机构 * Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 Pilot-Commit 框架,通过预算感知的展开分配策略,优先将计算资源分配给高信息量的提示,从而在组策略优化中减少采样成本并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10515 2026-05-26 cs.LG cs.CL 86%

Adaptive Preference Optimization with Uncertainty-aware Utility Anchor

基于不确定性感知效用锚点的自适应偏好优化

Xiaobo Wang, Zixia Jia, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种通用离线偏好优化框架UAPO,通过引入锚点函数估计偏好数据标注的不确定性,支持非配对数据训练,提升数据利用效率和训练鲁棒性。

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 86%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17003 2026-05-20 cs.LG cs.AI 86%

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

学习区能量:用于高效RL后训练的在线数据选择

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) THBI Lab(THBI实验室) Tsinghua University(清华大学) Dept. of Automation(自动化系)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出学习区能量(LZE)方法,通过在线数据选择框架集中计算在模型的主动学习前沿,提高RL后训练的效率,实验表明在多个数据集上表现优异,且计算资源消耗减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17997 2026-05-19 cs.LG cs.AI cs.CV 86%

MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

MARR: 模块自适应残差重建用于低比特后训练量化

Le Su, Xing Luo, Zhi Jin

机构 * Peng Cheng Laboratory(鹏城实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MARR,一种模块自适应残差重建方法,通过为每个模块分配特定的缩放系数,平衡残差相关的HA偏差和累积误差校正,从而在低比特量化中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15339 2026-05-11 cs.LG cs.CL 86%

UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types

UNA: 一种统一的监督框架,用于高效对齐跨反馈类型的大型语言模型

Zhichao Wang, Bin Bi, Can Huang, Shiva Kumar Pentyala, Zixu James Zhu, Sitaram Asur, Na Claire Cheng, Cheng Wan, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北得克萨斯大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 UNA框架通过通用隐式奖励函数统一处理二元、成对和评分反馈,理论证明其最优性,实验验证其在经典基准上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24804 2026-04-29 cs.LG cs.CL 86%

Intrinsic Mutual Information as a Modulator for Preference Optimization

内在互信息作为偏好优化的调节器

Peng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen

机构 * Sun Yat-sen University(中山大学) University of Warwick(华威大学) Macao Polytechnic University(澳门理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RMiPO框架,利用内在响应级互信息进行偏好优化,通过超参数调节动态解耦偏好贡献,减少训练开销,提升性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏