arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 54 篇

2605.28826 2026-05-29 cs.CL 86%

From Context Shift to Stylistic Collapse: Why Training Objectives Matter More Than Scale

从语境偏移到风格崩溃:为什么训练目标比规模更重要

Rohan Mahapatra

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 本文通过分析17个模型(410M-100B+参数)在24个语言探针上的表现,发现指令微调系统会导致语言熵沿语篇和结构维度系统性崩溃,并表明弱干预加剧崩溃而强控制可显著改善,揭示了当前对齐流程在重新分配风格概率质量方面的结构性局限。

Comments 26 pages, 13 tables, 2 figures. Planning to submit to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29414 2026-05-29 cs.CL cs.AI 86%

Beyond Bilingual Transfer: Multilingual Code-Switching in Instruction Tuning

超越双语迁移:指令微调中的多语言代码切换

Shunta Asano, Jeonghun Baek, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过跨四种语言的句子级多语言代码切换指令微调,验证了多语言代码切换能有效提升大语言模型的多语言理解性能,超越了传统双语迁移设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00065 2026-05-29 cs.LG cs.CL cs.CR 85%

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

当相同系数到达不同位置:跨大型语言模型移植分词器中的非对称可实现性

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文发现跨词汇模型组合中分词器移植的几何结构非对称性,并构造了“破坏令牌”以利用该漏洞,通过实验验证其在多个模型对中的存在性及对微调、谱滤波等防御措施的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20255 2026-05-29 cs.LG cs.CL cs.SE 85%

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

HE-SNR:通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对SWE-bench基准,提出基于熵压缩假说的HE-SNR指标,通过细粒度熵分析指导中期训练数据筛选,在高达560B参数模型上验证有效性。

Comments Accepted at ICML 2026. 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29498 2026-05-29 cs.CL cs.CV 84%

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting

Mask the Target: 一种即插即用的正则化器,用于对抗LoRA遗忘

Runze Xu, Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 针对LoRA微调中目标分布与原始训练分布差异大时导致的灾难性遗忘问题,提出一种无需重放数据的输出空间正则化方法,通过遮蔽目标token并仅对非目标词汇进行KL正则化,在不增加推理开销的前提下改善新学习与遗忘之间的平衡。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30232 2026-05-29 cs.LG cs.CL 84%

How's it going? Reinforcement learning in language models recruits a functional welfare axis

进展如何?语言模型中的强化学习招募了一个功能性福利轴

Andy Q Han, David J. Chalmers, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 指令微调 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文通过迷宫环境实验,发现强化学习会招募语言模型中预先存在的功能性福利表征(即对系统目标达成程度的估计),从而广泛影响模型行为,且该表征在训练前已存在。

Comments 81 pages, 43 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28896 2026-05-29 cs.LG 83%

Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models

LoRA适配器的特征几何:微调语言模型中表示差异的稀疏自编码器分析

Prasanth K K

机构 * Independent AI Safety Researcher(独立人工智能安全研究员)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本研究使用稀疏自编码器分析LoRA微调引起的表示几何变化,发现LoRA特征字典与预训练特征存在弱几何对齐,且适配器特定SAE能更有效重建delta激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29502 2026-05-29 cs.CL cs.AI 82%

Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

源语言锚定的语义强化学习用于低资源目标语言生成

Zeli Su, Ziyin Zhang, Zewei Pan, Zhou Liu, Dingcheng Huang, Dehan Li, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) South China University of Technology(华南理工大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出源语言锚定的语义强化学习(SG-SRL),通过跨语言语义奖励模型利用源语言单语数据,结合轻量级恢复阶段解决奖励黑客问题,在低资源目标语言生成中提升语义锚定和事实覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29561 2026-05-29 cs.AI cs.SE 81%

ParaTool: Shifting Tool Representations from Context to Parameters

ParaTool: 将工具表示从上下文转移到参数中

Zekai Yu, Qi Meng, Qizhi Chu, Yu Hao, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ParaTool框架,通过将每个工具投影为可加载的参数集,结合参数化工具预训练、软工具选择和参数化工具微调三个阶段,使大语言模型无需上下文文档即可进行工具调用,在Stable ToolBench和BFCL上显著优于基于ICL的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29495 2026-05-29 cs.LG 81%

On-Policy Replay for Continual Supervised Fine-Tuning

面向持续监督微调的在策略重放

Yan Chen, Taojie Zhu, Meng Zhang, Xin Chen, Jiaqi Huang, Dongyang Xu, Yizhi Wang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出在策略重放(OPR)方法,通过重放模型自身生成的高质量响应来缓解持续监督微调中的灾难性遗忘,在多个大语言模型上显著降低遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29115 2026-05-29 cs.CR cs.AI 81%

unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning

unix-ctf: 用于Unix能力强化学习的过程化环境

Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出unix-ctf,一个过程化生成shell代理的夺旗任务的环境,通过LLM辅助合成管道生成可复用的隐藏-查找脚本对,并基于此微调Qwen3-8B模型,将解决率从11.6%提升至43.6%,证明Unix能力是可分离、可训练的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29754 2026-05-29 cs.AI 79%

Benchmarking Positional Encoding Strategies for Transformer-Based EEG Foundation Models

基于Transformer的脑电图基础模型位置编码策略基准测试

Ayse Betul Yuce, Sebastian Stober

机构 * Department of Computer Science, Otto von Guericke University(奥托·冯·格里克大学计算机科学系)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究在CBraMod骨干网络中基准测试五种位置编码策略,通过线性探测和微调协议评估运动想象分类和情感识别任务,发现最优策略具有任务依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29300 2026-05-29 cs.CL cs.AI cs.SD 79%

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

MusTBENCH:音乐大语言模型中的时间定位基准与推进

Daeyong Kwon, Qiyu Wu, Shinobu Kuriya, Junghyun Koo, Shuyang Cui, Zhi Zhong, Wei-Hsiang Liao, Hiromi Wakaki, Yuki Mitsufuji

机构 * Seoul National University(首尔国立大学) Sony Group Corporation(索尼集团) Sony AI(索尼人工智能)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MusTBENCH基准和MusT四阶段优化方法,评估并提升音乐大语言模型在音频中的时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29969 2026-05-29 cond-mat.mtrl-sci cond-mat.dis-nn 78%

Prototype-Guided Latent Alignment for Data-Efficient Fine-Tuning of Molecular Foundation Models

原型引导的潜在对齐用于分子基础模型的数据高效微调

Rushikesh Pawar, Harshit Rawat, Ayush Kumar, Phani Motamarri

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出基于原型的对齐方法,通过将目标域原子的能量贡献对齐到源域原型,实现分子基础模型在低数据下的高效微调,在rMD17和SPICE数据集上能量MAE降低高达18%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30265 2026-05-29 cs.CV cs.CL 77%

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

LoMo: 局部模态替换以实现更深的视觉-语言融合

Feng Han, Zhixiong Zhang, Zheming Liang, Yibin Wang, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29801 2026-05-29 cs.AI cs.CL cs.CR cs.CV cs.LG 75%

AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security

AgentDoG 1.5:一种轻量级且可扩展的AI智能体安全与安保对齐框架

Dongrui Liu, Yu Li, Zhonghao Yang, Peng Wang, Guanxu Chen, Yuejin Xie, Qinghua Mao, Wanying Qu, Yanxu Zhu, Tianyi Zhou, Leitao Yuan, Zhijie Zheng, Qihao Lin, Yimin Wang, Haoyu Luo, Shuai Shao, Chen Qian, Qingyu Liu, Ling Tang, Ruiyang Qin, Qihan Ren, Junxiao Yang, Kun Wang, Zhiheng Xi, Linfeng Zhang, Ranjie Duan, Bo Zhang, Wenjie Wang, Wen Shen, Qiaosheng Zhang, Yan Teng, Chaochao Lu, Rui Mei, Man Li, Jialing Tao, Xi Lin, Tianhang Zheng, Yong Liu, Quanshi Zhang, Lei Zhu, Xingjun Ma, Junhua Liu, Hui Xue, Xiaoxiang Zuo, Xiangnan He, Chao Shen, Xianglong Liu, Minlie Huang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对开放世界智能体的新兴安全风险,提出一种轻量级可扩展的安全对齐框架,通过更新安全分类法、构建数据引擎并训练小模型(0.8B-8B参数),实现与闭源模型相当的性能,并降低部署开销两个数量级。

Comments 44 pages, 12 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30244 2026-05-29 cs.CV cs.AI 70%

Reinforcement Learning with Robust Rubric Rewards

基于稳健评分规则的强化学习

Ya-Qi Yu, Hao Wang, Fangyu Hong, Xiangyang Qu, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对部分可验证的视觉-语言任务,提出RLR^3方法,通过双路径执行评分规则、最小暴露策略和层次聚合,实现从任务级到准则级验证的扩展,在15个基准上平均提升4.7分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29716 2026-05-29 cs.AI 70%

NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs

NaRA: 面向扩散大语言模型参数高效微调的噪声感知LoRA

Shuaidi Wang, Zhan Zhuang, Ruping Huang, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系,香港,中国) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港理工大学计算机科学与工程系,香港,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对扩散大语言模型,提出噪声感知低秩适配(NaRA),通过噪声条件超网络生成低秩核心矩阵,实现沿去噪轨迹连续变化的更新矩阵,在常识推理、数学推理和代码生成基准上优于噪声无关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29580 2026-05-29 cs.LG stat.ML 70%

On the Construction and Implications of Low-Loss Valleys in LoRA-based Bayesian Inference

基于LoRA的贝叶斯推理中低损失谷的构造与启示

Daniel Dold, Emanuel Sommer, Julius Kobialka, Oliver Dürr, David Rügamer

机构 * HTWG Konstanz(康斯坦茨应用科学大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LoRA-Curve方法,通过分段贝塞尔曲线参数化在LoRA空间中连接独立最优解,形成连续低损失谷,并结合平坦极小扰动和JS散度正则化,在不牺牲性能的前提下提高预测分布的互信息,实现功能多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30189 2026-05-29 cs.CR cs.AI cs.CL cs.LG 67%

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

LoRA适配器后门中的令牌级泛化:攻击表征与行为检测

Travis Lelle

机构 * Travis Lelle

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据投毒在LoRA适配器中植入后门,发现后门在令牌特征层面泛化而非结构模式层面,并提出了基于行为统计和权重统计的两种检测方法。

Comments 45 pages, 27 tables. Code and evaluation data: https://github.com/Travis-ML/lora-backdoors. Trained adapter weights available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30093 2026-05-29 cs.CV 67%

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence

几何至关重要:用于学习语义对应的3D基础先验

Artur Jesslen, Olaf Dünkel, Adam Kortylewski

机构 * University of Freiburg(弗赖堡大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)

专题命中 指令微调 :foundation model(abstract);post-training(abstract)

AI总结 提出一种3D感知的后训练框架,利用3D基础模型(SAM3D)估计物体几何和姿态,生成几何感知特征图,结合DINO和Stable Diffusion特征,通过测地距离过滤候选对应,训练轻量适配器改进语义对应。

Comments 9 pages (main paper), 21 pages (total), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30132 2026-05-29 cs.LG stat.ML 57%

Learning to Extrapolate to New Tasks: A Relational Approach to Task Extrapolation

学习外推到新任务:一种关系型任务外推方法

Adam Ousherovitch, Yixin Wang

机构 * Department of Statistics, University of Michigan, Ann Arbor(统计学系,密歇根大学,安阿伯)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 提出关系型任务外推器(RTE),通过将目标任务分解为锚定任务和变换关系并学习关系算子,实现向未见任务的系统性外推,在函数预测和序列预测中显著优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27809 2026-05-29 cs.LG cs.CR 57%

Density-aware Sample-specific Attack

密度感知的样本特定攻击

Qiyuan Wang, Yao Li, Raymond K. W. Wong

机构 * Texas A&M University(德克萨斯A&M大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 提出一种通过将触发样本引导至干净数据分布的低密度区域来优化后门攻击的双层优化方法,在微调和剪枝防御下均保持高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27975 2026-05-29 cs.LG stat.ML 57%

Continual Learning in Modern Hopfield Networks with an Application to Diffusion Models

现代Hopfield网络中的持续学习及其在扩散模型中的应用

Ken Takeda, Masafumi Oizumi, Ryo Karakida

机构 * Graduate School of Arts and Science, The University of Tokyo(东京大学艺术与科学研究生院) Artificial Intelligence Research Center, AIST(AIST人工智能研究中心)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 通过现代Hopfield能量分析扩散模型中的持续学习,证明高能量异常样本更容易被遗忘,并基于能量选择重放样本以缓解遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10020 2026-05-29 stat.ML cs.LG q-bio.BM 57%

Calibrating Generative Models to Distributional Constraints

生成模型的分布约束校准

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe

机构 * Stanford University, Palo Alto, CA USA(斯坦福大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 针对生成模型采样分布统计量偏离期望的校准问题,提出将校准形式化为受约束优化问题,并通过松弛损失和奖励损失两种替代目标进行微调,在蛋白质设计、图像生成和语言建模等应用中显著降低了数百个同时约束下的校准误差。

Comments To appear at the International Conference on Machine Learning (ICML), 2026. Codebase accompanying the paper is available at: https://github.com/smithhenryd/cgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30257 2026-05-29 cs.CV 50%

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

Stable-Layers: 使用VLM评分强化学习微调图像层分解模型

Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss

机构 * Stability AI

专题命中 指令微调 :language model(abstract)

AI总结 提出Stable-Layers框架,通过强化学习(Flow-GRPO)和视觉语言模型(VLM)评分,无需配对监督即可微调预训练层分解模型,解决评分信号方差不足问题,提升层分离质量和重建精度。

Comments 25 pages, 8 figures, 4 tables. Project page: https://stability-ai.github.io/stable-layers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29726 2026-05-29 cs.CV 50%

SLAD : Shared LoRA Adapters for Task Specific Distillation

SLAD:用于任务特定蒸馏的共享LoRA适配器

Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau

机构 * IMT Atlantique(IMT阿登蒂克) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出SLAD方法,通过共享低秩适配器参数对齐教师和学生模型的特征表示,实现高效的知识蒸馏,在多个分类和分割数据集上达到最先进性能。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21746 2026-05-29 cs.CV 50%

Getting to the Point: Pointing Improves LVLMs at Counting

直击要点:指向提升LVLMs的计数能力

Simone Alghisi, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 指令微调 :language model(abstract)

AI总结 提出Point-then-Count方法,通过生成目标物体坐标进行零样本计数,在多个LVLM上取得最高准确率,并揭示坐标编码的空间信息是性能提升的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29460 2026-05-29 cs.CV 50%

FedSmoothLoRA: Toward Smoother and Faster Convergence in Federated Low-Rank Adaptation

FedSmoothLoRA:面向更平滑和更快速收敛的联邦低秩适配

Zehao Wang, Guanglei Yang, Yihan Zeng, Hang Xu, Hongzhi Zhang, Wangmeng Zuo, Chun-Mei Feng

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College Dublin(都柏林大学学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对联邦低秩适配中更新空间有限、轮间状态不匹配和客户端无关起始状态的问题,提出FedSmoothLoRA框架,通过轮匹配矩阵和梯度对齐矩阵实现更平滑和更快速的收敛。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 24 篇

2605.29782 2026-05-29 cs.LG cs.AI cs.CL 93%

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

Hista 和 Numca:为 LLM 强化学习有效估计状态值

Zizhe Chen, Jiqian Dong, Yizhou Tian, Garry Yang, Yongqiang Chen, Zhitang Chen, James Cheng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对 LLM 强化学习中状态值估计不准确的问题,提出 Numca(利用数值跨度作为可分级里程碑)和 Hista(利用隐藏状态加权平均不连续轨迹及其回报)两种方法,显著提升估计精度和训练性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏