arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 78 篇

2512.08984 2026-05-12 cs.CV cs.AI 81%

RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition

RAG-HAR:基于检索增强生成的人类活动识别

Nirhoshan Sivaroopan, Hansi Karunarathna, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney Australia(悉尼大学澳大利亚分校) University of Sri Jayewardenepura Sri Lanka(Sri Jayewardenepura大学 Sri Lanka) Curtin University Australia(Curtin大学澳大利亚分校) Colorado State University USA(科罗拉多州立大学美国分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAG-HAR提出一种无需训练的检索增强框架,利用大语言模型实现人类活动识别,通过轻量统计描述符和语义相似样本检索提升识别准确性和实用性。

Comments Accepted to IEEE PerCom 2026 (Pervasive computing and communications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 81%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01237 2026-05-12 cs.LG 81%

The Differences Between Direct Alignment Algorithms are a Blur

直接对齐算法之间的差异变得模糊

Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文系统比较了直接对齐算法,发现排名目标是影响对齐质量的主要因素,而特定的标量分数次之。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10272 2026-05-12 cs.LG cs.AI cs.CR cs.DC 81%

DP-LAC: Lightweight Adaptive Clipping for Differentially Private Federated Fine-tuning of Language Models

DP-LAC:轻量级自适应截断用于差分隐私联邦微调语言模型

Haaris Mehmood, Jie Xu, Karthikeyan Saravanan, Rogier Van Dalen, Mete Ozay

机构 * Samsung AI Centre Cambridge(三星剑桥人工智能中心)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DP-LAC,通过隐私直方图估计估计初始截断阈值,并在训练过程中自适应调整,无需额外隐私预算或新超参数,提升联邦微调语言模型的隐私保护与准确性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10903 2026-05-12 cs.CV cs.RO 80%

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

CapVector:在参数空间中学习可转移的能力向量用于视觉-语言-动作模型

Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 本文提出一种方法,通过在参数空间中解耦辅助目标SFT的两个目标,提升通用能力与任务特定动作分布拟合,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL 80%

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17251 2026-05-12 cs.LG 79%

SCOPE: Structured Prototype-Guided Adaptation for EEG Foundation Models with Limited Labels

SCOPE:结构化原型引导适应EEG基础模型以有限标签

Jingying Ma, Feng Wu, Yucheng Xing, Qika Lin, Tianyu Liu, Chenyu Liu, Ziyu Jia, Mengling Feng

机构 * Saw Swee Hock School of Public Health, National University of Singapore(新加坡国立大学 Saw Swee Hock 公共卫生学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Guangzhou Research Translation and Innovation Institute, National University of Singapore(新加坡国立大学广州研究翻译与创新研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Beijing Key Laboratory of Brainnetome and Brain-Computer Interface, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网络与脑机接口重点实验室) Brainnetome Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网络中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 针对有限标签下EEG基础模型适应难题,提出SCOPE框架,通过外部监督和原型引导提升模型鲁棒性与效率,实验显示在多种任务和比例下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10247 2026-05-12 cs.CV cs.AI 79%

LPT: Less-overfitting Prompt Tuning for Vision-Language Model

LPT: 降低过拟合的提示微调用于视觉-语言模型

Chenhao Ding, Xinyuan Gao, Songlin Dong, Jizhou Han, Qiang Wang, Zhengdong Zhou, Yuhang He, Yihong Gong

机构 * IEEE(国际电气电子工程师协会)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08702 2026-05-12 cs.CV cs.AI 79%

Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models

门与融合:面向视觉语言模型的零样本组合个性化

Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Gate-and-Merge框架,实现视觉语言模型的零样本组合个性化,通过轻量LoRA适配器和门控机制,在无需共现训练的情况下提升多概念联合识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04899 2026-05-12 cs.LG 79%

A geometric relation of the error introduced by sampling a language model's output distribution to its internal state

语言模型输出分布采样引入的误差与内部状态的几何关系

Albert F. Modenbach

机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。

Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10345 2026-05-12 cs.CV 78%

BGG: Bridging the Geometric Gap between Cross-View images by Vision Foundation Model Adaptation for Geo-Localization

BGG: 通过基于视觉基础模型的适应方法弥合跨视角图像间的几何差距以实现地理定位

Wei Wang, Dou Quan, Ning Huyan, Shuang Wang, Yi Li, Pei He, Licheng Jiao

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China, Xidian University(中国教育部智能感知与图像理解重点实验室,西安电子科技大学) School of Telecommunications, Xidian University(西安电子科技大学电信学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出BGG框架,通过多粒度特征增强适配器和频率感知结构聚合模块,有效提升跨视角地理定位性能,实验表明其在低训练成本下达到最先进的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 77%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10318 2026-05-12 cs.CL 77%

Extending Confidence-Based Text2Cypher with Grammar and Schema Aware Filtering

基于语法和模式意识的文本到Cypher扩展

Makbule Gulcin Ozsoy

机构 * Neo4j(Neo4j公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究如何在文本到Cypher推理中利用结构约束提高查询正确性,通过扩展置信度框架加入序列过滤过程,结合置信度评分、语法验证和模式约束,提升生成查询的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08769 2026-05-12 cs.AI 77%

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS:学习执行时间的多智能体系统工作流

Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Zhejiang University(浙江大学) ShanghaiTech University(上海理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvoMAS通过动态构建执行时间工作流,改进多智能体系统的协作策略,实验证明其在复杂任务中优于单智能体基线和现有自动化方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08560 2026-05-12 cs.CV cs.AI 77%

ZAYA1-VL-8B Technical Report

ZAYA1-VL-8B 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * Zyphra

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 ZAYA1-VL-8B 是基于内部语言模型 ZAYA1-8B 构建的紧凑多专家视觉语言模型,在多个图像理解、推理和计数基准上超越了 Qwen2.5-VL-3B、PLM-3B 和 MolmoE-1B 等模型。

Comments 20 pages, 7 figures, 3 appendices (with 31 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06524 2026-05-12 cs.AI 77%

Process Matters more than Output for Distinguishing Humans from Machines

过程比输出更能区分人类与机器

Milena Rmus, Mathew D. Hardy, Thomas L. Griffiths, Mayank Agrawal

机构 * Roundtable Technologies Inc.(Roundtable技术公司) Princeton University(普林斯顿大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出CogCAPTCHA30测试人类与机器的行为过程差异,发现过程特征比性能指标更有效区分两者,但任务特定过程监督在跨任务迁移时效果下降,凸显过程定义的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08158 2026-05-12 cs.CV cs.AI 77%

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10674 2026-05-12 cs.LG cs.AI cs.CL cs.SE 75%

Step Rejection Fine-Tuning: A Practical Distillation Recipe

步骤拒绝微调:一种实用的蒸馏配方

Igor Slinko, Ilia Zavidnyi, Egor Bogomolov, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出步骤拒绝微调方法,通过利用未解决轨迹中的正确部分提升模型性能,实验显示其在SWE-bench Verified任务中将分辨率率提升至32.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04811 2026-05-12 cs.CL cs.AI cs.LG 75%

SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization

SE-Bench:基于知识内化的自我进化基准测试

Jiarui Yuan, Tailin Jin, Weize Chen, Zeyuan Liu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 SE-Bench通过构建封闭书本训练环境,揭示了知识内化过程中开放书本悖论、RL差距及自博弈的有效性,为自我进化能力评估提供了严谨的诊断平台。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09533 2026-05-12 cs.CL cs.AI 73%

Assessment of RAG and Fine-Tuning for Industrial Question-Answering-Applications

对RAG和微调在工业问答应用中的评估

Jakob Sturm, Josef Pichlmeier, Christian Bernhard, Maka Karalashvili, Johannes Klepsch, Georg Groh, Andre Luckow

机构 * BMW Group(宝马集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过汽车行业封闭数据集评估RAG和微调在问答系统中的效果,发现RAG在质量和成本效率上优于微调,尤其适用于开源模型。

Comments Accepted at AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08423 2026-05-12 cs.LG cs.CL stat.ML 73%

Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms

可查询的LoRA:基于共享低秩更新原子的指令正则化路由

Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj

机构 * Department of Computer Science(计算机科学系) Department of Government(政府系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Statistics and Data Sciences(统计与数据科学系)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种数据自适应的参数高效微调方法,通过共享可查询的记忆体实现动态路由,结合指令正则化提升模型适应性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08177 2026-05-12 cs.LG cs.AI 73%

Echo-LoRA: Parameter-Efficient Fine-Tuning via Cross-Layer Representation Injection

Echo-LoRA:通过跨层表示注入实现参数高效微调

Yihang Peng, Peng Jin, Jie Gong, Xingyuan Chen, Lingjiao Xu, Ning Su, Yan Ran

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(西南石油大学计算机科学与软件工程学院) School of Electronic Information and Artificial Intelligence, Leshan Normal University(乐山师范学院电子信息与人工智能学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Echo-LoRA通过跨层表示注入提升参数高效微调效果,在八个常识推理基准上超越LoRA基线,减少训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10741 2026-05-12 cs.LG 70%

AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery

AdaPaD: 适应性并行消去用于PEFT的自校正秩发现

Barbara Su, Fangshuo Liao, Anastasios Kyrillidis

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AdaPaD通过自校正机制实现并行消去,使秩分布成为输出而非输入,证明误差指数衰减并提供泛化界限,实验证明其在参数预算下与自适应秩LoRA基线和固定秩LoRA竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16097 2026-05-12 cs.CL 70%

Incremental Multilingual Text2Cypher with Adapter Combination

增量多语言文本到图结构的适配器组合

Makbule Gulcin Ozsoy

机构 * Neo4j London UK(Neo4j伦敦英国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种可扩展的多语言文本到图结构方法,通过训练语言特定的LoRA适配器并结合统一线性融合或学习融合MLP,实现无需全量微调即可支持新语言,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL 70%

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09875 2026-05-12 cs.AI 70%

Cross-Family Universality of Behavioral Axes via Anchor-Projected Representations

通过锚定投影表示实现跨家族行为轴的普遍性

Su-Hyeon Kim, Yo-Sub Han

机构 * Department of Artificial Intelligence(人工智能系) Yonsei University(延世大学) Department of Computer Science(计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出锚定投影框架,通过共享锚坐标空间实现不同模型行为方向的对齐与迁移,验证了跨家族表示层面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09640 2026-05-12 cs.CV cs.LG 70%

Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning

通过强化微调克服视觉连续学习中的灾难性遗忘

Meng Lou, Hanzhong Guo, Linwei Chen, Yizhou Yu

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出RaPO方法,通过轨迹级奖励塑造缓解强化微调在连续学习中的遗忘问题,实验证明其在视觉连续学习中有效减少灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI 70%

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08527 2026-05-12 cs.DC cs.AI 70%

MARLaaS: Multi-Tenant Asynchronous Reinforcement Learning as a Service

MARLaaS:多租户异步强化学习即服务

Timothy Tin Long Yu, Gursimran Singh, Ge Shi, Hanieh Sadri, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MARLaaS通过轻量LoRA适配器共享基础模型和异步架构解耦训练流程,实现多任务并发强化学习细调,提升加速器利用率4.3倍,训练时间缩短85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03303 2026-05-12 cs.CL 70%

LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning

LoRA-FA:高效且有效的低秩表示微调

Longteng Zhang, Lin Zhang, Shaohuai Shi, Xiaowen Chu, Bo Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LoRA-FA,通过冻结投影下矩阵A并训练投影上矩阵B,有效提升低秩适应性能,同时减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏