Zero-Order Optimization for LLM Fine-Tuning via Learnable Direction Sampling
通过可学习方向采样实现LLM微调的零阶优化
专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种基于可学习策略的方向采样方法,用于改进零阶优化在LLM微调中的性能,通过减少方差和依赖维度来提升效果。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过可学习方向采样实现LLM微调的零阶优化
专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG
AI总结 本文提出了一种基于可学习策略的方向采样方法,用于改进零阶优化在LLM微调中的性能,通过减少方差和依赖维度来提升效果。
ScalSelect: 可扩展的无训练多模态数据选择用于高效的视觉指令微调
机构 * East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; The Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Huazhong University of Science and Technology(华中科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.AI
AI总结 ScalSelect提出一种无训练、可扩展的多模态数据选择方法,通过线性时间复杂度实现高效视觉指令微调,实验显示其性能接近甚至超越全数据训练。
Comments The code is available at \href{https://github.com/ChangtiWu/ScalSelect}{ScalSelect}
主动零:通过主动环境探索实现自我进化的视觉-语言模型
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; Wuhan AI Research(武汉人工智能研究所) ; Tsinghua University(清华大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 Active-Zero通过主动环境探索实现视觉-语言模型的自我进化,提升推理和理解任务的性能。
字符串思维种子:用于大语言模型的提示方法以实现分布忠实和多样化生成
机构 * Sakana AI
专题命中 指令微调 :prompting(title,abstract);LLM(abstract);分类 cs.AI
AI总结 SSoT通过引入随机字符串生成和提取机制,提升大语言模型在分布忠实和多样化生成任务中的性能。
Comments Accepted to ICLR 2026
无需人工标注的预训练视觉-语言模型微调
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) ; Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)
专题命中 指令微调 :language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。
FedLoDrop: 带Dropout的联邦LoRA用于通用大语言模型微调
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; Department of Electronic and Electrical Engineering, Southern University of Science and Technology(电子与电气工程系,南方科技大学) ; School of Electronic Information, Wuhan University(电子信息学院,武汉大学) ; Centre for Wireless Communications, University of Oulu(无线通信中心,奥卢大学) ; Department of Electrical and Electronic Engineering, The University of Hong Kong(电气与电子工程系,香港大学)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 FedLoDrop通过Dropout和资源优化提升联邦LoRA在大语言模型微调中的泛化能力
Comments The paper has been accepted for publication in IEEE Journal on Selected Areas in Communications on Jan. 31 2026
NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) ; Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) ; State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)
专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。
ModalTune: 通过多模态信息细调滑片级基础模型以实现数字病理学中的多任务学习
机构 * Sunnybrook Research Institute(辛普森布鲁斯研究所在) ; University of Toronto(多伦多大学) ; Google Research(谷歌研究)
专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG
AI总结 ModalTune通过引入多模态信息和大型语言模型,实现数字病理学中多任务学习的统一细调框架,提升癌症生存和亚型预测性能。
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025
通过LoRA专家混合生成可操作建议:一种双语言模型管道用于问题提取和商业推荐
机构 * BITS Pilani,Pilani Campus(BITS 普利尼校区)
专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本文提出一种双语言模型管道,通过LoRA专家混合策略生成基于客户评价的可操作商业建议,提升问题提取和建议生成的准确性与效率。
探索表格基础模型的微调
机构 * Lexsi Labs(Lexsi实验室)
专题命中 指令微调 :foundation model(title,abstract);SFT(abstract);分类 cs.LG
AI总结 本文研究了表格基础模型在不同数据集上的微调效果,发现零样本性能已较强,而微调效果依赖于模型和数据特性,提出了基于不同方法的实践指导。
协同优于差异:一种基于分区的多领域LLM微调方法
机构 * Nanjing University(南京大学) ; Airon Technology CO., LTD(艾瑞森技术有限公司) ; University of Bristol(布里斯托大学) ; The University of Oklahoma(俄克拉荷马大学) ; Donghua University(东华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出一种基于分区的多领域LLM微调方法,通过平衡领域差异与协同效应,有效减少领域间干扰,提升多领域适应性能。
Comments 20 pages, 5 figures, 21 tables. Accepted at NeurIPS 2025. Corresponding author: Xuan Zhang (xuanzhang2199@gmail.com)
用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突
机构 * ERNIE Team, Baidu(百度ERNIE团队) ; College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。
Comments 13 pages, 5 figures
CADmium:通过代码语言模型进行文本驱动的顺序CAD设计微调
机构 * Chandar Research Lab(昌德拉研究实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Polytechnique Montréal(蒙特利尔理工学院) ; Ansys(安世仿真) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 CADmium通过微调代码语言模型,利用大规模标注数据集实现文本驱动的CAD设计自动化,提升设计效率。
Comments Published in Transactions on Machine Learning Research (TMLR) 01/2026
Journal ref Transactions on Machine Learning Research (TMLR) 01/2026; https://openreview.net/forum?id=lExqWvQht8
通过微调蛋白质语言模型和树搜索提升硅基定向进化
机构 * Department of Computer Science(计算机科学与工程系) ; Engineering, The Chinese University of Hong Kong(香港中文大学) ; Hangzhou Institute of Medicine, Chinese Academy of Sciences(中国科学院杭州医学研究所)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 AlphaDE通过微调蛋白质语言模型和树搜索提升硅基定向进化效率
Comments working in progress, 20 pages, 6 figures, 16 tables, updating template
Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。
Comments Add real-world experiments
用于偏微分方程发现的动态贝叶斯优化框架用于指令微调
机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)
专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 NeuroSymBO通过动态贝叶斯优化框架提升偏微分方程发现任务中的指令微调效果,实现更优的解决方案和更高的恢复率。
高效估计语言模型微调的数据效率
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 本文提出通过梯度余弦相似度预测语言模型微调的数据效率,减少不必要的标注成本。
通过风险感知的逐步对齐实现约束语言模型策略优化
机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) ; University College London(伦敦大学学院) ; Institute for AI, Peking University(北京大学人工智能研究院)
专题命中 指令微调 :language model(title,abstract);RLHF(abstract);分类 cs.AI
AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。
重新思考微调:解锁视觉-语言模型中的隐藏能力
机构 * College of Engineering, Northeastern University(东北大学工程学院) ; Khoury College of Computer Science, Northeastern University(东北大学计算机科学学院)
专题命中 指令微调 :language model(title,abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出基于MFT的结构重参数化方法,通过重新组织VLMs内部子网络实现高效微调,超越LoRA和全微调,无需改变骨干网络。
层级感知的视觉-语言模型微调
机构 * University of Washington(华盛顿大学) ; Intel(英特尔)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。
UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能
机构 * Tsinghua University(清华大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。
Comments 22 pages
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025
沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性
机构 * School of Science and Technology(科学与技术学院) ; Kwansei Gakuin University(冈山大学) ; School of Engineering & Computer Science(工程与计算机科学学院) ; Victoria University of Wellington(惠灵顿维多利亚大学)
专题命中 指令微调 :LLM(title);SFT(abstract);RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。
小批量训练语言模型:当普通SGD有效,以及为何梯度累积是浪费
机构 * New York University(纽约大学) ; Columbia University(哥伦比亚大学)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.LG
AI总结 本研究发现小批量训练可稳定训练语言模型,优于大批次,且能使用普通SGD实现稳定训练,无需动量和优化器状态。
Comments NeurIPS 2025. Code available at: https://github.com/martin-marek/batch-size
双层零阶优化:高效的LLM微调与元训练
机构 * Department of Computer Science University of Maryland - College Park(计算机科学系马里兰大学- College Park) ; Department of Computer Science and Engineering University of Texas at Arlington(计算机科学与工程系德克萨斯理工大学阿灵顿分校)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 Bilevel-ZOFO结合了快速的FO-PEFT内循环和稳定的ZO外循环,实现高效LLM微调与元训练,提升训练速度和泛化能力。
SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架
专题命中 指令微调 :LLM(title,abstract);SFT(abstract);分类 cs.CL
AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。
Comments Code available at https://github.com/Harry20030331/SumForU
深度方向激活引导用于诚实语言模型
机构 * University of Warsaw(华沙大学) ; MARS(对齐研究学生导师计划) ; Center for AI Safety(人工智能安全中心)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 深度方向激活引导方法通过高斯调度提升语言模型的诚实性,无需训练或微调,有效增强模型真实报告能力。
Comments See \url{https://github.com/marysia/gaussian-activation-steering}. for code and experiments
ExLLM:基于经验的LLM优化用于分子设计及其他
机构 * University of Manchester(曼彻斯特大学) ; Zhongzhengcun Academy(中关村学院)
专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.LG
AI总结 ExLLM通过引入经验增强机制,改进了LLM在分子设计及其他领域的优化性能,提升了探索效率和收敛速度。
Comments 10 pages, under review
开庭吧:一种基于大语言模型代理的漏洞检测方法
机构 * School of Computing and Information Systems, Singapore Management University, Singapore(计算与信息系统学院,新加坡管理大学,新加坡) ; School of Computer Science, University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚)
专题命中 指令微调 :LLM(title,abstract);instruction tuning(abstract);分类 cs.AI
AI总结 VulTrial通过多代理框架利用大语言模型检测漏洞,显著提升检测效率并发现多个零日漏洞。
在基于大语言模型的恶意软件检测与解释中的准确性与效率权衡:参数调优与全微调的比较研究
机构 * Department of Cybersecurity University at Albany - State University of New York Albany, NY, USA(网络安全系 美国纽约州立大学阿尔巴尼分校)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究比较了参数调优与全微调在恶意软件检测中的性能,发现LoRA在保持解释质量的同时显著提升了效率。
Comments Accepted in IEEE Big Data 2025
Journal ref IEEE Big Data 2025
时间旅行:借助Git Bisect的LLM辅助语义行为定位
机构 * University of Waterloo(滑铁卢大学) ; Brock University(布罗克大学)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用LLM和Git Bisect进行语义行为定位,通过结构化推理链提升故障定位准确率,实验显示成功率提升6.4个百分点,平均bisect时间减少2倍。
Comments submitted to Git Bisect SCALCOM 2025 Calgary (to be published)