arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 83 篇

2606.01412 2026-06-02 cs.LG cs.IT math.IT 70%

GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation

GPTQ-intrinsic LoRA: 一种用于低秩自适应低精度量化的近最优算法

Shihao Zhang, Rayan Saab

机构 * Department of Mathematics, University of California San Diego(数学系,加州大学圣地亚哥分校) Department of Mathematics and Halıcıoğlu Data Science Institute, University of California San Diego(数学系和Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出GPTQ-intrinsic LoRA算法,通过将低秩校正直接融入GPTQ量化过程,并利用信息论下界证明其近最优性,在语言和视觉模型上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01230 2026-06-02 cs.AI 70%

HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

HomeFlow: 面向智能家居智能体训练的可验证数据飞轮

Yi Gu, Huacan Wang, Shuo Zhang, Yuqing Hou, Lei Xue, Weipeng Ming, Chen Liu, Fangzhou Yu, Kuan Li, Ronghao Chen, Sen Hu, Xiaofeng Mou, Yi Xu

机构 * Midea Group(美的集团) Beijing University of Posts and Telecommunications(北京邮电大学) Donghua University(东华大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HomeFlow,一种通过统一仿真环境HomeEnv、程序化家居生成HomeMaker、蓝图编译用户意图、MCTS-Flow合成可验证轨迹,并结合监督微调和逐步RLVE优化智能体的可验证数据飞轮方法,在SmartHome-Bench上达到84.60%和87.03%的任务成功率,其中8B模型超越GPT-5.5 1.23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01148 2026-06-02 cs.CL 70%

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

并非所有解释都能同等模拟:比较言语化特征归因与自生成理由

Pingjun Hong, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过反事实模拟设置,比较了言语化特征归因和自生成理由两种解释来源对问答模型行为可模拟性的影响,发现解释格式和粒度显著影响模拟效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00902 2026-06-02 cs.AI 70%

Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

Ryze:从生物医学论文中合成富含证据的数据

Yeqi Huang, Yue Chen, Yanwei Ye, Guanhao Su, Luo Mai

机构 * University of Edinburgh(爱丁堡大学)

专题命中 指令微调 :LLM(abstract);post-training(abstract);分类 cs.AI

AI总结 提出 Ryze 系统,自动从生物医学论文中生成包含完整证据结构的训练数据,并训练出领域专用 VLM BioVLM-8B,在 LAB-Bench 上以低于 200 美元成本达到 48.0% 加权准确率。

Comments Accepted at ACL 2026 System Demonstrations Track. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00545 2026-06-02 cs.LG 70%

The Assistant as a Privileged Persona: A canonical reference in cross-persona self-recognition

助手作为特权角色:跨角色自我识别中的规范参考

Asvin G

机构 * Institute for Advanced Study, Princeton(普林斯顿高级研究院)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究后训练语言模型在跨角色作者身份判断中的表现,发现助手角色作为规范参考,其熵信号和角色向量距离紧密耦合,且这种耦合仅对助手角色成立。

Comments Project out of Anthropic Fellows

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00382 2026-06-02 cs.LG 70%

CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs

CRMA:用于大语言模型模块化持续微调的谱约束骨干

Kiran Nayudu, Aswini Nutakki, Sai Vinay Naidu, Ashwin Shanmugasundaram

机构 * ModelBrew AI

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CRMA残差适配器,通过Sinkhorn归一化确保混合矩阵双随机,从而在结构上约束谱范数,实现共享基座的持续训练与跨任务正向迁移,无需回放或蒸馏。

Comments 38 pages, 10 figures. Patent-pending construction details deferred to companion technical report (in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09095 2026-06-02 cs.CL cs.CV 70%

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

阅读,而非思考:理解并弥合多模态大语言模型中文本变为像素时的模态差距

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu, Chen Zhao, Cheng Zhang, Mark Dredze, Fan Bai

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊) New York University(纽约大学) Texas A&M University(德克萨斯大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统诊断多模态大语言模型在处理图像文本时的模态差距,发现其源于模型推理意愿不足而非感知失败,并提出一种轻量级自蒸馏方法有效弥合该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05367 2026-06-02 cs.CR cs.AI 70%

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs

进退维谷:大型语言模型中伦理推理与安全对齐之间的张力

Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18877 2026-06-02 cs.LG 70%

RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models

RefLoRA:重构低秩适配以实现大型模型的高效微调

Yilang Zhang, Bingcong Li, Georgios B. Giannakis

机构 * Department of ECE University of Minnesota(电子工程系明尼苏达大学) Department of CS ETH Zürich(计算机科学系苏黎世联邦理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LoRA因非唯一低秩分解导致权重更新不一致和性能下降的问题,提出RefLoRA方法,通过每步优化最小化损失上界的低秩分解,促进更平坦的损失景观和稳定收敛,在自然语言理解和常识推理任务上优于现有LoRA变体且计算开销可忽略。

Comments Accepted as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20945 2026-06-02 math.GR math.DS 67%

Self-simulability of graph products

图积的自模拟性

Kanéda Blot, Ville Salo

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 研究图积的自模拟性,证明无限有限生成群的图积自模拟当且仅当其定义图没有由可解群组成的分隔团,并应用于图积在可解子群上的分裂。

Comments 24 pages, 3 figures; v3 removes an f.p. assumption, and corrects the history on the geometric side

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01024 2026-06-02 cs.CL cs.AI 62%

DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs

DSL-LLaDA: 将连续去噪扩展到8B掩码扩散语言模型

Longxuan Yu, Yunshu Wu, Yu Fu, Siheng Xiong, Rob Brekelmans, Hui Liu, Yue Dong, Greg Ver Steeg

机构 * University of California, Riverside(加州大学河滨分校) Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过离散随机定位(DSL)将预训练掩码扩散语言模型(LLaDA-8B-Instruct)轻量适配为支持连续嵌入空间去噪,在低步数下实现高质量摘要生成并避免长度-质量权衡。

Comments 8 pages, 4 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00831 2026-06-02 cs.AI cs.LG 62%

Subliminal Learning is a LoRA Artifact

潜意识学习是LoRA的伪影

Todd Nief, Harvey Yiyun Fu, Mark Muchane, Ari Holtzman

机构 * Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现潜意识学习是LoRA微调产生的伪影,其传递行为与LoRA秩呈倒U型关系,且完全微调下消失,表明该现象依赖于微调和评估上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00647 2026-06-02 cs.CL cs.AI 62%

LinguIUTics at PsyDefDetect: Iterative Imbalance-Aware Fine-tuning of Qwen3-8B for Psychological Defense Mechanism Classification

LinguIUTics 在 PsyDefDetect 中的研究:用于心理防御机制分类的迭代不平衡感知微调 Qwen3-8B

Shefayat E Shams Adib, Ahmed Alfey Sani, Md Hasibur Rahman Alif, Ajwad Abrar

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Dhaka, Bangladesh(计算机科学与工程系,伊斯兰技术大学,达卡,孟加拉国)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 针对对话文本中心理防御机制检测的类别不平衡问题,提出基于 QLoRA 微调 Qwen3-8B 的迭代不平衡感知方法,通过分组分层交叉验证、少数类轮询词汇增强和后处理流水线,在 PsyDefDetect 2026 共享任务中达到宏 F1 0.3917,排名第4。

Comments Accepted at PsyDefDetect, a shared task at the 25th BioNLP Workshop (BioNLP 2026), co-located with ACL 2026 in San Diego, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11832 2026-06-02 cs.AI cs.LG 62%

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

安全幻象:虚假相关性如何破坏VLM安全微调及通过机器遗忘缓解

Yiwei Chen, Yuguang Yao, Yihua Zhang, Bingquan Shen, Gaowen Liu, Sijia Liu

机构 * Michigan State University(密歇根州立大学) National University of Singapore(新加坡国立大学) Cisco Research(思科研究)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现视觉语言模型(VLM)的安全微调存在“安全幻象”,即虚假相关性导致脆弱性,并提出机器遗忘作为替代方案,显著降低攻击成功率和不必要拒绝。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07218 2026-06-02 cs.LG cs.AI stat.ML 62%

Collaborative and Efficient Fine-tuning: Leveraging Task Similarity

协作高效微调:利用任务相似性

Gagik Magakyan, Amirhossein Reisizadeh, Chanwoo Park, Pablo A. Parrilo, Asuman Ozdaglar

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出CoLoRA方法,通过共享适配器和个性化适配器利用任务相似性进行协作微调,提升数据稀缺下的模型性能,并在理论和实验上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02463 2026-06-02 cs.CV cs.AI 61%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI;foundation model(comments)

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01710 2026-06-02 cs.CV cs.LG 57%

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

零样本VLM中虚假相关性的密度感知转换

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Victoria, Australia(计算与信息系统学院,墨尔本大学,维多利亚,澳大利亚)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 提出密度感知转换(DAT)方法,利用局部几何密度项修正图像-文本相似度,以缓解CLIP等视觉语言模型在零样本分类中因虚假相关性导致的性能下降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01612 2026-06-02 cs.CV cs.LG 57%

Self-Improving Small Object Grounding in LVLMs

LVLMs中的自改进小目标定位

Tianze Yang, Yucheng Shi, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 利用LVLMs内部注意力模式,通过轻量级IoU回归器或无需训练的注意力熵选择器,从多个候选框中选出最佳框,实现小目标定位的自改进。

Comments 29 Pages, 15 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21422 2026-06-02 cs.LG 57%

PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning

PRISM:基于偏好感知影响函数的数据选择方法用于高效微调

Qihao Lin, Guanxu Chen, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.LG

AI总结 提出PRISM方法,通过偏好感知影响函数对目标示例加权,构建偏好感知目标方向,优先选择有效驱动模型匹配目标行为的数据,提升高效微调和安全对齐微调性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20806 2026-06-02 cs.AI 57%

Safety Alignment of LMs via Non-cooperative Games

通过非合作博弈实现语言模型的安全对齐

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01374 2026-06-02 cs.CL 57%

Bridging the Gap: Transfer Learning from English PLMs to Malaysian English

弥合差距:从英语PLM到马来西亚英语的迁移学习

Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对马来西亚英语的低资源克里奥尔语特性,通过微调预训练语言模型MENmBERT和MENBERT,在命名实体识别和关系抽取任务上分别提升1.52%和26.27%的性能。

Comments Accepted in 9th Workshop on Representation Learning for NLP (Rep4NLP) at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00872 2026-06-02 cs.CV 56%

Images as Tables: In-Context Learning with TabPFN for Low-Data Detection of AI-Generated Images

图像作为表格:利用TabPFN进行上下文学习以实现低数据量下AI生成图像的检测

Jan Philip Walter, Shashank Agnihotri, Margret Keuper

机构 * Jan Philip Walter Shashank Agnihotri Margret Keuper

专题命中 指令微调 :foundation model(abstract,comments)

AI总结 提出将图像转换为表格形式,使用冻结的DINOv3骨干网络提取特征,并通过TabPFN进行上下文学习,在低数据量下有效检测AI生成图像,优于现有方法。

Comments Accepted as a Spotlight Oral at the ICML 2026 Workshop Foundation Models for Structured Data. *Equal Contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03766 2026-06-02 cs.CV cs.NE q-bio.NC 50%

FOVI: A biologically-inspired foveated interface for deep vision models

FOVI:一种受生物启发的深度视觉模型中央凹接口

Nicholas M. Blauch, George A. Alvarez, Talia Konkle

机构 * harvard(哈佛大学) nvidia

专题命中 指令微调 :foundation model(abstract)

AI总结 受人类视觉系统启发,提出基于视网膜和V1的中央凹接口FOVI,通过kNN卷积和低秩适应实现高效变分辨率视觉处理,在减少像素和计算成本的同时保持竞争力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02792 2026-06-02 cs.CV 50%

RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation

RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制

Lexi Pang, Liheng Zhang, Hang Ye, Xiaoxuan Ma, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :prompting(abstract)

AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02591 2026-06-02 cs.CV 50%

Zero-Shot Multi-Animal Tracking in the Wild

野外零样本多动物跟踪

Jan Frederik Meier, Timo Lüddecke

机构 * Institute of Computer Science and Campus Institute Data Science(计算机科学研究所和校园数据科学研究院)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文基于视觉基础模型,结合Grounding DINO与SAM 2,通过三项针对性修改实现无需重新训练或调参的零样本多动物跟踪,在多个数据集上取得最优结果。

Comments CV4Animals Workshop at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 33 篇

2606.01635 2026-06-02 cs.CL cs.AI 92%

AlphaToken: Decoupling Adaptation and Stability for Path-Aware Response Token Valuation in LLM Post-Training

AlphaToken: 在LLM后训练中解耦适应性与稳定性的路径感知响应令牌估值

Liu Qing, Ou Wu, Yi Du

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出AlphaToken框架,通过解耦适应性(促进目标任务学习)和稳定性(保持预训练能力)并引入路径感知机制,利用Fisher漂移代理和Ghost点积扩展实现高效令牌估值,从而在微调和偏好优化中屏蔽低价值令牌,提升后训练性能并缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-06-02 cs.CR cs.LG 91%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);prompting(abstract);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00392 2026-06-02 cs.LG cs.AI 90%

Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization

通过约束策略优化实现检测器规避的LLM释义

Mingyi Wang, Zhuoer Shen, Yuheng Bu, Shaofeng Zou

机构 * School of ECEE, Arizona State University(亚利桑那州立大学电子工程与计算机科学学院) Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出DEPO算法,将检测器规避的LLM释义建模为约束马尔可夫决策过程,通过拉格朗日对偶强化学习在保持语义的同时实现高效规避。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03238 2026-06-02 cs.HC 89%

RLHF May Not Reflect Genuine Preferences

RLHF 可能不反映真实偏好

Bijean Ghafouri, Eun Cheol Choi, Priyanka Dey, Emilio Ferrara

专题命中 后训练与偏好优化 :RLHF(title,title_cn)

AI总结 本文指出 RLHF 中的标注响应可能并非真实偏好,通过提出测量有效性诊断方法,发现不一致性具有系统性偏差,过滤高不一致标注者会显著改变模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10623 2026-06-02 cs.LG cs.AI 89%

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏