Analyzing the Effect of Noise in LLM Fine-tuning
分析在LLM微调中的噪声影响
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究不同噪声类型对LLM微调内部学习动态的影响,分析噪声在不同任务和模型中的表现,发现标签噪声导致最大性能下降,而语法和拼写噪声可能带来轻微正则化收益。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
分析在LLM微调中的噪声影响
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究不同噪声类型对LLM微调内部学习动态的影响,分析噪声在不同任务和模型中的表现,发现标签噪声导致最大性能下降,而语法和拼写噪声可能带来轻微正则化收益。
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 指令微调 :language model(title,abstract);prompting(title,abstract);large language model(title);分类 cs.CL
Comments Accepted at The Fifth Workshop on New Frontiers in Summarization (NewSumm) in The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
机构 * Institute of Computer Science Polish Academy of Sciences(计算机科学研究所波兰科学院)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL
机构 * Google(谷歌)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL
Comments 20 pages excluding reference list, 2 figures
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL
Comments AAAI 2025
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title);分类 cs.CL
针对表格数据生成的大型语言模型指令微调——一天内完成
机构 * SIT(新加坡科技学院) ; NUS(新加坡国立大学)
专题命中 指令微调 :instruction tuning(title,abstract);large language model(title);language model(title);LLM(abstract)
AI总结 本文提出了一种在有限资源下通过指令微调提升LLM表格数据生成能力的方法,利用高质量数据集和少量指令实现与GPT-4o相当的生成性能。
Comments Accepted International Conference on Machine Learning (ICML 2025), 1st Workshop on Foundation Models for Structured Data
在大型语言模型中进行持续学习:方法、挑战与机遇
机构 * Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文综述了针对大型语言模型的持续学习方法,分析了持续预训练、微调和对齐的核心阶段,探讨了传统方法在持续学习中的适应性与改进,并指出在跨任务和时间尺度的知识整合中仍存在挑战。
大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向
机构 * Hangzhou Normal University(杭州师范大学) ; Zhejiang University(浙江大学) ; China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) ; Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) ; The University of Melbourne(墨尔本大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。
Comments 39 pages, 7 figures, 22 tables
Journal ref Software: Practice and Experience, 2026
HealthSLM-Bench:面向移动与可穿戴医疗监护的小型语言模型基准测试
机构 * School of Computing and Information Systems, University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) ; School of Computer Science, University of Auckland, New Zealand(奥克兰大学计算机科学学院)
专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本研究构建HealthSLM-Bench基准,评估小型语言模型(SLMs)在医疗预测任务的表现,发现SLMs性能接近大型语言模型且效率、隐私性更优,为隐私保护型医疗监护提供新方向。
Comments 9 pages, 6 tables, 6 figures. Accepted at NeurIPS 2025 Workshop on GenAI4Health
Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译
机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。
Comments CP 2026 Workshop on LLMs meet Constraint Solving
SHINE:一种可扩展的上下文超网络,用于在单次传递中将上下文映射到LoRA
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Technion, NVIDIA(技术学院与NVIDIA) ; University of Oxford(牛津大学) ; School of Electronics Engineering(电子工程学院) ; Computer Science, Peking University(计算机科学,北京大学)
专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出SHINE,一种可扩展的上下文超网络,用于在单次传递中将多样且有意义的上下文映射到高质量的LoRA适配器,通过重用冻结LLM的自身参数和引入架构创新,克服了先前超网络的关键限制,以较少的参数实现了强大的表达能力。
面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议
机构 * Sanya University(三亚大学) ; Hebei International Studies University(河北国际 Studies 大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。
混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证
机构 * Technical University Munich(慕尼黑工业大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。
Comments Paper has been accepted at 9th wiNLP workshop at EMNLP
为什么多步工具使用强化学习会崩溃以及监督信号如何修复它
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。
MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划
机构 * Waymo LLC(Waymo有限责任公司)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。
Journal ref ICRA 2026
大型语言模型在持续微调过程中灾难性遗忘的机制分析
机构 * Division of Statistics and Machine Learning (STIMA), Department of Computer and Information Science (IDA), Linköping University(统计与机器学习系(STIMA)、计算机与信息科学系(IDA)、利厄普堡大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.LG
AI总结 本文系统比较了20个顶级LLM在持续微调中的灾难性遗忘,通过行为分析和机制解释定位易受参数覆盖的神经回路,并提出低秩电路投影(LRCP)方法,在开放权重模型中恢复高达94.2%的祖先能力。
Comments 12 pages, 8 figures, 5 tables. Preprint submitted to Elsevier
兼容性感知的动态微调用于大型语言模型
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学科技学院电脑与信息科学系及智慧城市物联网国家重点实验室) ; Auckland University of Technology(奥克兰理工大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 提出兼容性感知动态微调(CADFT),通过模型似然度动态调整监督更新,抑制不兼容样本的高方差梯度,提升训练稳定性和泛化能力。
Comments ACL 2026
迷失在代码对话者的流程中:揭示代码任务中大语言模型的指令微调税
机构 * Singapore Management University(新加坡国立管理学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)
AI总结 本研究首次实证发现指令微调在代码任务中导致权衡:增强指令遵循能力却削弱代码填充性能,称之为“指令微调税”,并通过定性和定量分析总结出七项发现和四项启示。
Comments 25 pages, 6 figures. Evaluation toolkit and dataset: https://github.com/arkosioscambions/CodeTalkers
大语言模型用于不平衡分类:多样性至关重要
机构 * Applied Artificial Intelligence Initiative (A 2 I 2 )(应用人工智能倡议(A2I2)) ; Deakin University(德肯大学) ; Black Dog Institute(黑狗研究所) ; University of New South Wales(新南威尔士大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出基于大语言模型的过采样方法,通过条件采样、排列微调和插值样本增强多样性,在10个表格数据集上优于8个基线方法。
HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体
机构 * University of Minnesota ; Northwestern University ; Amazon AGI ; Texas A\&M University ; Cisco Research
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。
Comments ICML 2026
从元思维到执行:面向通用且可靠的大语言模型推理的认知对齐后训练
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 指令微调 :LLM(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种认知启发的两阶段后训练框架,通过元思维链监督学习通用策略和置信度校准强化学习优化执行可靠性,在分布内和分布外分别提升2.10%和3.86%。
SMILE-Next: 教授大型语言模型检测、分类和推理笑声
机构 * School of EE, KAIST(韩国科学技术院电子工程系) ; Dept. of EE, POSTECH(POSTECH电子工程系) ; School of Computing, KAIST(韩国科学技术院计算机科学系)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出SMILE-Next数据集和包含笑声特定Self-Instruct与混合笑声专家框架的方法,用于实现多模态笑声理解,显著优于基线模型。
Journal ref Annual Meetings of the Association for Computational Linguistics 2026
微调大语言模型用于自动化算法设计
机构 * City University of Hong Kong(香港城市大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)
AI总结 本文探讨了微调大语言模型以提升其在自动化算法设计中的性能,提出了一种多样性感知的排名策略和直接偏好优化方法,通过实验验证了任务特定微调在不同算法设计任务中的有效性。
DarkLLM: 利用大语言模型学习语言驱动的对抗攻击
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学) ; Tongji University(同济大学)
专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 本文提出DarkLLM,一种基于大语言模型的对抗攻击框架,通过将自然语言攻击指令转换为潜在攻击向量,生成有效的对抗扰动,统一了多种攻击类型并实现了灵活可控的对抗生成。
Comments 23 pages, 13 figures
在大型语言模型中微调与上下文学习:从形式语言学习的角度
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Boston University(波士顿大学)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文从形式语言学习的角度比较了大型语言模型中的微调与上下文学习,通过设计精确的语言边界、受控字符串采样和无数据污染的任务,发现微调在分布内泛化上优于上下文学习,而两者在分布外泛化上表现相当,且两者在不同熟练度水平上的归纳偏置也有所不同。
Comments Accepted at ACL 2026 (Main)
基于区域的表格理解强化学习:Table-R1
机构 * Beihang University(北京航空航天大学) ; Xingchen AGI Lab(星辰AGI实验室) ; China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))
专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Table-R1,通过区域证据增强和TARPO优化提升LLM的表格理解能力,在多个数据集上提升14.36个百分点,同时降低响应token消耗。
为聚合物-复合材料增材制造领域进行大型语言模型的领域适应:使用检索增强生成与微调
机构 * Department of Mechanical Engineering and Engineering Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校机械工程与工程科学系) ; Department of Electrical and Computer Engineering, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校电气与计算机工程系)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文研究了通过检索增强生成和微调来适应大型语言模型至增材制造领域的方法,发现检索增强生成在准确性和相关性上优于单纯微调。
当情绪成为触发:利用情绪风格动态后门攻击寄生大语言模型
机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) ; School of Computer Science, China West Normal University(西南大学计算机科学学院) ; School of Electronic and Information Engineering, Lanzhou Jiaotong University(兰州交通大学电子信息工程学院)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出Paraesthesia攻击,通过情绪风格动态后门触发机制,在大语言模型中实现高隐蔽性的恶意输出。
一种可扩展的基于实体的LLM偏见审计框架
机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国原子能委员会,List)
专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 本文提出一种可扩展的基于实体的LLM偏见审计框架,通过合成数据测量模型行为中的系统性差异,揭示了模型对政治倾向、国家和地区、公司类型等的偏见,并指出模型规模和提示语言对偏见的影响。