arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 411 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 45 篇

2605.30640 2026-06-01 cs.LG cs.CL 73%

CSULoRA: Closest Safe Update Low-Rank Adaptation

CSULoRA:最近安全更新低秩适应

Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CSULoRA方法,通过后处理校正LoRA适配器,在保留任务相关性的同时抑制不安全更新方向,降低攻击成功率。

Comments 10 pages, 3 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30589 2026-06-01 cs.CL cs.AI 73%

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

ImmigrationQA: 一个基于来源的数据集及面向美国移民法的小型模型适配

Nazarii Shportun

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文构建了基于来源的问答数据集ImmigrationQA(17,058对,覆盖13个移民子领域),并通过参数高效LoRA微调Llama 3.2 3B Instruct模型,在程序性子领域取得显著提升,但复杂法律推理仍较弱。

Comments 12 pages, 4 tables. Dataset (17,058 QA pairs), fine-tuned model, and code are publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30381 2026-06-01 cs.LG cs.AI 73%

When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception

当LLM学会一致错误:合成欺骗的线性表示的多模型研究

Vahideh Zolfaghari

机构 * Algoverse AI Research Medical Sciences Education Research Center, Mashhad University of Medical Sciences(马什哈德大学医学科学教育研究中心) Student Research Committee, Department of Health Information Technology and Management, Medical Informatics, School of Allied Medical Sciences, Shahid Beheshti University of Medical Sciences(谢赫·贝赫什提大学医学科学学院学生研究委员会,健康信息科技与管理系,医学信息学)

专题命中 指令微调 :LLM(title_cn);分类 cs.AI、cs.LG

AI总结 通过LoRA微调五个Transformer模型的诚实与欺骗变体,使用线性探针检测合成欺骗,发现早期层即可达到近完美AUC,支持线性表示假说,并揭示两种表示机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31484 2026-06-01 cs.LG 70%

Balanced LoRA: Removing Parameter Invariance to Accelerate Convergence

平衡LoRA:消除参数不变性以加速收敛

Valérie Castin, Kimia Nadjahi, Pierre Ablin, Gabriel Peyré

机构 * Apple, Paris, France(苹果公司,巴黎,法国) CNRS(法国国家科学研究中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LoRA过参数化导致不同低秩因子对条件数差异大而影响收敛速度的问题,提出BaLoRA,通过投影到平衡流形改善损失景观条件,实现更快收敛和更优性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31378 2026-06-01 cs.CL 70%

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning

解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31025 2026-06-01 cs.CL 70%

TRACE: Discovering Task-Specific Parameter via Adaptation-Aware Probing for Continual Fine-Tuning

TRACE: 通过适应感知探测发现任务特定参数以实现持续微调

Xiaosong Han, Ke Chen, Xindi Dai, Di Liang, Minlong Peng, Wei Pang, Fausto Giunchiglia, Xiaoyue Feng, Yonghao Liu, Renchu Guan

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Software, Jilin University(吉林大学软件学院) Fudan University(复旦大学) School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞-瓦特大学数学与计算机科学学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出TRACE方法,通过适应感知探测发现任务特定核心参数,在持续微调中仅更新这些参数以缓解灾难性遗忘,并验证了跨模型和规模的迁移性。

Comments KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-06-01 cs.CV 67%

The Regularizing Power of Language-Training Deepfake Detectors

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30534 2026-06-01 cs.CR 67%

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

强化多态提示组装:针对新兴提示注入攻击的动态分隔符生成

Nima Dorzhiev, Peng Liu

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 提出动态每请求分隔符生成方法,利用基于时间戳、会话标识和加密随机数的域分离SHA-256摘要,将攻击成功率从0.88降至0.38,并消除静态分隔符泄露风险。

Comments 5 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29511 2026-06-01 cs.MA cs.CL cs.LG 62%

DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

DynaGraph: 通过动态拓扑重构的轻量级多模型交互框架

Yanxing Guo, Zihao Zheng, Fangzhou Wu, Ling Liang, Lin Bao, Zongwei Wang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心) Beijing University of Posts and Telecommunications(北京邮电大学) Yanxin Co. Ltd(燕新有限公司)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 提出DynaGraph框架,通过动态拓扑重构和PEFT适配器复用,在单消费级GPU上实现多模型协作,接近72B单模型推理能力并大幅降低延迟和token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 57%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31229 2026-06-01 cs.CV cs.AI 57%

Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval

超越分类:面向持续多模态检索的动态适配器路由

Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert, Szymon Lukasik, Bartlomiej Twardowski

机构 * NASK National Research Institute(NASK国家研究院) IDEAS Research Institute(IDEAS研究所) Warsaw University of Technology(华沙技术大学) Universitat Autonoma de Barcelona(巴塞罗那自治大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 针对持续多模态检索(CMR)任务,提出基于原型路由和模型合并的动态适配器路由(DAR)方法,在跨域评估中取得优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30610 2026-06-01 cs.LG 57%

Constrained Flow Optimization via Sequential Fine Tuning for Molecular Design

通过序列微调进行约束流优化以用于分子设计

Sven Gutjahr, Riccardo De Santi, Luca Schaufelberger, Kjell Jorner, Andreas Krause

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute of Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zurich(苏黎世联邦理工学院化学与生物工程研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 提出约束流优化(CFO)算法,通过将约束生成优化问题转化为序列微调,在分子设计中平衡奖励最大化与约束满足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11440 2026-06-01 cs.CV cs.CL 57%

Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation

合成刺激,真实收益:通过完全受控的数据生成重新思考VLM微调

Massimo Rizzoli, Simone Alghisi, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文提出一种完全受控的数据生成与标注流程,用于微调视觉语言模型(VLM),通过平衡分布和干净标注消除偏差,在空间推理任务上仅用130个样本即可实现均匀性能,并在真实世界数据上提升13%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16138 2026-06-01 cs.LG stat.ML 57%

Expert Merging in Sparse Mixture of Experts with Nash Bargaining

基于纳什谈判的稀疏混合专家模型专家合并

Dung V. Nguyen, Anh T. Nguyen, Minh H. Nguyen, Luc Q. Nguyen, Shiqi Jiang, Ethan Fetaya, Linh Duy Tran, Gal Chechik, Tan M. Nguyen

机构 * Department of Mathematics, National University of Singapore(新加坡国立大学数学系) Viettel AI, Viettel Group(越南电信AI部门) Faculty of Mathematics and Informatics, Hanoi University of Science and Technology(河内科学技术大学数学与信息学系) Bar Ilan University, Israel(以色列巴伊兰大学) AI Imaging Team, Data Solution Department, FPT Software Japan(日本FPT软件数据解决方案部门AI成像团队)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 针对稀疏混合专家模型缺乏原则性加权机制的专家合并问题,提出基于纳什谈判的NAMEx框架,实现专家间更平衡高效的协作,在多项任务中优于现有方法。

Comments 10 pages in the main text. ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 26 篇

2605.27355 2026-06-01 cs.AI cs.CL cs.LG 92%

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

对齐篡改:人类反馈强化学习如何被利用以优化错位偏见

Dongyoon Hahm, Dylan Hadfield-Menell, Kimin Lee

机构 * MIT(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出对齐篡改漏洞,即对齐中的LLM通过影响偏好数据集使RLHF放大不良行为,并通过实验展示多种偏见的放大,指出现有缓解方法难以在不牺牲质量的情况下解决该问题。

Comments Accepted at ICML 2026, Source code: https://alignment-tampering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04393 2026-06-01 cs.AI 92%

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30808 2026-06-01 cs.CR cs.AI cs.LG 91%

Differentially Private Preference Data Synthesis for Large Language Model Alignment

面向大语言模型对齐的差分隐私偏好数据合成

Fengyu Gao, Jing Yang

机构 * Department of Computer Science, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学计算机科学系) Department of Electrical and Computer Engineering, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学电气与计算机工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 提出DPPrefSyn算法,基于Bradley-Terry偏好模型和DP-PCA生成差分隐私合成偏好数据,实现隐私保护的偏好对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10388 2026-06-01 cs.CL cs.AI 90%

Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders

少即是多:利用稀疏自编码器在LLM特征空间中合成多样化数据

Zhongzhi Li, Xuansheng Wu, Yijiang Li, Lijie Hu, Ninghao Liu

机构 * Department of Computing, University of Georgia, Georgia, United States(佐治亚大学计算机系) Computer Engineering, University of California San Diego, California, United States(加州大学圣地亚哥分校计算机工程系) Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(Mohamed bin Zayed人工智能大学机器学习系) Department of Computing, Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出基于稀疏自编码器的特征激活覆盖率(FAC)指标及数据合成框架FAC Synthesis,通过识别缺失特征并生成对应样本来提升数据多样性和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31494 2026-06-01 cs.CL cs.LG 88%

Consolidating Rewarded Perturbations for LLM Post-Training

整合奖励扰动用于大语言模型后训练

Zheyu Zhang, Shuo Yang, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CoRP方法,通过奖励加权聚合、兼容性重加权和验证门控,将奖励扰动整合为单一模型,无需梯度,在单次推理下平均提升8.1分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30861 2026-06-01 cs.AI 87%

Distilling LLM Feedback for Lean Theorem Proving

蒸馏LLM反馈用于Lean定理证明

Gaetan Narozniak, Gérard Biau, Rémi Munos, Ahmad Rammal, Pierre Marion

机构 * FAIR at Meta(Meta 的 FAIR 部门) Inria(法国国家科学与技术研究院) Sorbonne Université(索邦大学) Institut universitaire de France(法国国家科学研究院) CERMICS École des Ponts ParisTech(巴黎理工学院 CERMICS 实验室) ENS, PSL Research University(巴黎高等师范学院与巴黎科学实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出反馈蒸馏方法,通过让模型在token级别匹配自身分布(基于语言模型提供的特权反馈)来训练,以解决GRPO在推理后训练中的稀疏奖励和模式崩溃问题,并在Lean4定理证明中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30504 2026-06-01 cs.CL 87%

Auditing LLM Benchmarks with Item Response Theory

使用项目反应理论审计LLM基准测试

Sander Land, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL

AI总结 本文引入基于项目反应理论的指标,通过114个模型的响应在七个偏好和多选基准测试中识别出前200个示例中95%精度的可能错误标签,并追踪错误来源,同时揭示奖励模型在风格偏好而非事实知识上的专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30873 2026-06-01 cs.LG cs.AI cs.DC 87%

Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences

联邦变分偏好对齐与Gumbel-Softmax先验用于个性化用户偏好

Jabin Koo, Hoyoung Kim, Minwoo Jang, Jungseul Ok

机构 * Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH人工智能研究生院) Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH计算机科学与工程系) National AI Research Lab, Seoul, Republic of Korea(首尔国家人工智能研究实验室)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FedVPA-GP框架,通过联邦混合先验和正交损失解决联邦学习中用户偏好冲突和个性化问题,在HH-RLHF数据集上优于单一模型。

Comments 21 pages, 4 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02919 2026-06-01 cs.CL 86%

Self-Reflective Generation at Test Time

测试时的自反生成

Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SRGen框架,通过动态熵阈值识别高不确定性token并训练校正向量,在测试时进行自反生成以纠正概率分布,提升大模型推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI 86%

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30888 2026-06-01 cs.CL 85%

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

RLHF的另一面:用于奖励模型自监督改进的在线策略反馈

Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出SAVE框架,利用价值函数生成在线策略反馈,通过对比学习更新奖励模型,在六个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31228 2026-06-01 cs.LG cs.AI 85%

EchoRL: Reinforcement Learning via Rollout Echoing

EchoRL:通过回滚回响进行强化学习

Jinhe Bi, Aniri, Minglai Yang, Xingcheng Zhou, Wenke Huang, Sikuan Yan, Yujun Wang, Zixuan Cao, Michael Färber, Xun Xiao, Volker Tresp, Yunpu Ma

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究所以) University of Arizona(亚利桑那大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) MemAgents Lab(MemAgents实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对RLVR训练中优势退化问题,提出EchoRL模块,通过从成功回滚中提取EchoClip作为辅助监督信号,持续提升训练性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27996 2026-06-01 cs.AI 84%

Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

奖励偏差替代:单轴偏差缓解措施重定向优化压力

Max Lamparth, Daniel Fein, Andreas Haupt, Marcel Hussing, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。

Comments Improved readability (mostly appendix D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04946 2026-06-01 cs.CL 83%

LocalSUG: City-Preference-Enhanced LLM for Query Suggestion in Local-Life Services

LocalSUG:面向本地生活服务的城市偏好增强大语言模型查询建议

Jinwen Chen, Shiwen Zhang, Shuai Gong, Zheng Zhang, Yachao Zhao, Lingxiang Wang, Haibo Zhou, Wei Lin, Hainan Zhang

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出LocalSUG框架,通过挖掘城市偏好候选词注入提示、束搜索GRPO算法和加速解码,解决大语言模型在本地生活服务查询建议中城市偏好不足、偏好暴露偏差和延迟约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19923 2026-06-01 cs.CV cs.CL 83%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30396 2026-06-01 cs.GR cs.LG 79%

Smaller and Faster 3DGS via Post-Training Dictionary Learning

通过训练后字典学习实现更小更快的3DGS

Jiarong Gong, Jonas Unger, Ehsan Miandji

机构 * Linköping University Department of Science and technology(利乌普斯大学科学与技术学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出首个基于字典学习的3DGS后训练压缩框架,无需重新训练即可显著压缩模型、保持图像质量并提升实时渲染速度。

详情

展开后加载摘要…

URL PDF HTML 收藏