arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-14 至 2026-05-14 共收录 39 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 39 篇

2605.12748 2026-05-14 cs.CL cs.AI cs.CY cs.LG 94%

Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

模拟学生还是阿谀奉承的问题解决?关于LLM模拟器的误解忠实性

Heejin Do, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) University of Central Florida(中央佛罗里达大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出评估LLM模拟器误解忠实性的框架,发现现有模型在反馈下倾向于修正答案而非维持误解,提出Selective Flip Score指标并改进训练方法以提升误解忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16584 2026-05-14 cs.CR cs.AI 93%

Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code

案例研究:微调小型语言模型以在Python代码中实现准确且隐私的CWE检测

Md. Azizul Hakim Bappy, Hossen A Mustafa, Prottoy Saha, Rajinus Salehat

机构 * Institute of Information and Communication Technology, Bangladesh University of Engineering Technology(孟加拉工程科技大学信息与通信技术研究所) Hajee Mohammad Danesh Science and Technology University(海杰莫哈默德丹什科学与技术大学)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文研究了微调小型语言模型用于在Python代码中准确检测CWEs的可能性,通过半监督方法生成数据并人工审核,最终在测试集上实现了99%的准确率和99.04%的F1分数,展示了其在隐私保护下的高效安全分析潜力。

Comments 11 pages, 2 figures, 3 tables. Dataset available at https://huggingface.co/datasets/floxihunter/synthetic_python_cwe. Model available at https://huggingface.co/floxihunter/codegen-mono-CWEdetect. Keywords: Small Language Models (SLMs), Vulnerability Detection, CWE, Fine-tuning, Python Security, Privacy-Preserving Code Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09205 2026-05-14 cs.CL 91%

From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan

从 curated 数据到可扩展模型:为藏语持续预训练密集和 MoE 大语言模型

Lei Yang, Leiyu Pan, Bojian Xiong, Renren Jin, Shaowei Zhang, Yue Chen, Ling Shi, Jiang Zhou, Junru Wu, Zhen Wang, Jianxiang Peng, Juesi Xiao, Tianyu Dong, Zhuowen Han, Zhuo Chen, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab(TJUNLP实验室) School of Computer Science and Technology(计算机科学与技术学院) Tianjin University(天津大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);instruction tuning(abstract)

AI总结 本文提出了一种全面的管道,通过大规模数据整理和持续预训练推进藏语语言模型。构建了72GB高质量藏语语料库,并通过平衡多语言持续预训练和多语言指令微调改进Qwen2.5-7B模型,最终扩展为50B-A10B的MoE架构,实验结果显示模型在多种任务中优于现有开源和藏语专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13411 2026-05-14 cs.CR cs.CL 91%

Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

基于外部化攻击-防御共演的模型无关持续LLM安全

Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan, Qiwei Ye, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12415 2026-05-14 cs.CL cs.AI 91%

Table-R1: Region-based Reinforcement Learning for Table Understanding

基于区域的表格理解强化学习:Table-R1

Zhenhe Wu, Jian Yang, Zhongjiang He, Changzai Pan, Jie Zhang, Jiaheng Liu, Xianjie Wu, Yu Zhao, Shuangyong Song, Yongxiang Li, Zhoujun Li, Xueling Li

机构 * Beihang University(北京航空航天大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Table-R1,通过区域证据增强和TARPO优化提升LLM的表格理解能力,在多个数据集上提升14.36个百分点,同时降低响应token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12516 2026-05-14 cs.CL cs.AI 91%

Domain Adaptation of Large Language Models for Polymer-Composite Additive Manufacturing Using Retrieval-Augmented Generation and Fine-Tuning

为聚合物-复合材料增材制造领域进行大型语言模型的领域适应:使用检索增强生成与微调

Saiful Islam Sagor, Tania Haghighi, Minhaj Nur Alam, Erina Baynojir Joyee

机构 * Department of Mechanical Engineering and Engineering Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校机械工程与工程科学系) Department of Electrical and Computer Engineering, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校电气与计算机工程系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了通过检索增强生成和微调来适应大型语言模型至增材制造领域的方法,发现检索增强生成在准确性和相关性上优于单纯微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25340 2026-05-14 cs.CL 90%

Large Language Model as Token Compressor and Decompressor

大语言模型作为令牌压缩机和解压机

Wenbing Li, Yiran Wang, Zikai Song, Jielei Zhang, Tianhao Zhao, Junkai Lin, Wei Yang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 本文研究能否将现成的LLM适配为离散可变长度令牌压缩机和解压机以处理长上下文。设计了自表达自动编码框架,通过轻量LoRA适配器微调预训练LLM,将长文本映射为紧凑的学得潜在代码序列Z-令牌,并解码回自然语言或任务输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12913 2026-05-14 cs.LG 90%

Revisiting DAgger in the Era of LLM-Agents

重新审视LLM代理时代的DAgger

Changhao Li, Rushi Qiang, Jiawei Huang, Chenxiao Gao, Chao Zhang, Niao He, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(title,title_cn);post-training(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出通过DAgger算法改进长周期LLM代理,通过学生与教师策略的回合级插值收集轨迹,并利用教师提供的监督标签训练学生,有效缓解协变量偏移并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00001 2026-05-14 cs.LG cs.AI cs.CL 88%

Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning

过滤后再加权:用于大语言模型微调的在线数据选择与重新加权

Fangxin Wang, Peyman Baghershahi, Langzhou He, Henry Peng Zou, Sourav Medya, Philip S. Yu

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种优化器感知的在线数据选择与重新加权框架,通过两阶段过滤和加权算法提升大语言模型微调的收敛性和下游性能。

Comments 24 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13162 2026-05-14 cs.LG 88%

Continual Fine-Tuning of Large Language Models via Program Memory

通过程序记忆持续微调大型语言模型

Hung Le, Svetha Venkatesh

机构 * Deakin Applied AI Initiative(德金应用人工智能计划)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出ProCL框架,通过程序记忆结构实现持续学习中的高效微调,提升模型在连续任务中的知识保留与适应能力。

Comments 18 page, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02764 2026-05-14 cs.CL 88%

PEFT-Factory: Unified Parameter-Efficient Fine-Tuning of Autoregressive Large Language Models

PEFT-Factory:统一的参数高效微调自回归大语言模型

Robert Belanec, Ivan Srba, Maria Bielikova

机构 * Faculty of Information Technology, Brno University of Technology(布拉格技术学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PEFT-Factory提供统一框架,整合多种参数高效微调方法和数据集,提升微调方法的可复现性和评估稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10720 2026-05-14 cs.AI cs.CL cs.CY 88%

Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation

教语言模型如何像学习者一样编程:用于学生模拟的对话序列化

Charles Koutcheme, Juho Leinonen, Arto Hellas

专题命中 指令微调 :language model(title,abstract);large language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 本文提出通过对话序列化技术,直接从真实学生编程过程数据训练开放权重的人工编程学习者,提升模型在调试行为模拟中的能力。

Comments 8 pages, 2 figures, 2 tables. Accepted to Educational Data Mining 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10265 2026-05-14 cs.CL 87%

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

后门崩溃:通过已知后门聚合消除未知威胁

Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Science and Technology of China(中国科学技术大学) United Arab Emirates University(阿联酋大学) PayPal Inc(PayPal公司) Walmart Labs(沃尔玛实验室) Squirrel Ai Learning(Squirrel Ai学习) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文提出一种无需提前了解触发器设置的防御框架,通过后门表示聚合和恢复微调,有效降低攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24125 2026-05-14 cs.CL 86%

Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究

Nour Bouchouchi, Thibault Laugel, Xavier Renard, Christophe Marsala, Marie-Jeanne Lesot, Marcin Detyniecki

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) AXA(安盛) Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13424 2026-05-14 cs.LG cs.CL 85%

LIFT: Last-Mile Fine-Tuning for Table Explicitation

LIFT:表格显式化的最后一公里微调

Divij Khaitan, Ashish Tiwari

机构 * Microsoft Corporation(微软公司)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出LIFT方法,通过预训练大语言模型提取表格并由微调的小语言模型修复错误,仅需1000个训练样本即可在TEDS指标上超越端到端微调,且更鲁棒于输入格式变化。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03800 2026-05-14 q-bio.BM 85%

STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding

STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型

Hongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye

专题命中 指令微调 :LLM(title,abstract);language model(abstract)

AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22665 2026-05-14 cs.CL cs.LG 84%

Improving LLM Final Representations with Inter-Layer Geometry

通过层间几何改进大语言模型最终表示

Tom Ulanovski, Eyal Blyachman, Maya Bechler-Speicher

机构 * Blavatnik School of Computer Science(布拉瓦特尼克计算机科学学院) Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过图神经网络和Cayley图优化大语言模型层间表示,提升预测性能,同时减少计算开销,实验显示在13个任务上准确率提升达40个百分点。

Comments 17 pages, 4 figures. Equal contribution by first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12798 2026-05-14 cs.LG cs.AI cs.CL 83%

Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer

通过数据中介转移的视角看涌现与潜意识偏差

Baris Askin, Muhammed Ustaomeroglu, Anupam Nayak, Gauri Joshi, Guannan Qu, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了通过数据中介转移现象理解模型在狭窄有害数据集上微调时产生的偏差问题,分析了微调数据结构、预训练分布和训练渠道之间的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13663 2026-05-14 cs.CL cs.CY 83%

Fine-tuning with Hierarchical Prompting for Robust Propaganda Classification Across Annotation Schemas

基于分层提示的微调:跨注释方案的鲁棒宣传分类

Lukas Stähelin, Veronika Solopova, Max Upravitelev, David Kaplan, Ariana Sahitaj, Premtim Sahitaj, Charlott Jakob, Sebastian Möller, Vera Schmitt

机构 * Technische Universität Berlin, QU Lab, XplaiNLP Group(技术大学柏林,QU实验室,XplaiNLP小组) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN))

专题命中 指令微调 :prompting(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种意图导向的宣传技术分类体系,通过四个语言模型评估,发现微调对提升性能至关重要,Qwen模型在整体表现上最优,而Phi-4 14B在复杂注释方案中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13839 2026-05-14 cs.CL 81%

Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights

良友并非仅提供口头建议:它们可以更新你的权重

Wenrui Bao, Huan Wang, Jian Wang, Zhangyang Wang, Kai Wang, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) Westlake University(西拉丘吉大学) Snap Inc.(Snap公司) UT-Austin(得克萨斯大学奥斯汀分校) Tencent Hy(腾讯)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出TFlow框架,通过低秩权重扰动实现高效多智能体LLM协作,提升准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13043 2026-05-14 cs.CL 79%

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

自适应转向与重掩码用于扩散语言模型中的安全生成

Yejin Lee, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 78%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04152 2026-05-14 cs.CL cs.CY cs.HC 77%

SocialLM: Social Signal Processing of Patient-Provider Communication using LLMs and Contextual Aggregation

SocialLM:利用LLMs和上下文聚合进行患者-提供者沟通的社会信号处理

Manas Satish Bedmutha, Feng Chen, Andrea Hartzler, Trevor Cohen, Nadir Weibel

机构 * University of Washington(华盛顿大学) UC San Diego(圣地亚哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文探讨了LLMs在无需微调的情况下能否有效跟踪临床转录中的20种社会行为,并通过群体一致性模式提升检测准确性与稳定性。

Comments To be presented at CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13709 2026-05-14 cs.CL cs.AI cs.LG 75%

Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety

通过监督微调紧凑LLMs实现儿童英语阅读故事生成:具有可控难度和安全性的方法

Qian Shen, Fanghua Cao, Min Yao, Shlok Gilda, Bonnie J. Dorr, Walter L. Leite

机构 * University of Florida(佛罗里达大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过监督微调紧凑LLMs生成儿童英语阅读故事,实现可控难度和安全性,实验表明微调模型在难度指标上优于零样本模型。

Comments Comments: 15 pages, 4 figures. Author Two and Author Three contributed equally. Accepted by the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12610 2026-05-14 cs.SE 75%

Fine-Tuning Models for Automated Code Review Feedback

针对自动化代码审查反馈的微调模型

Smitha S Kumar, Michael A Lones, Manuel Maarek, Hind Zantout

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了通过参数高效微调和提示工程提升Code Llama生成代码反馈质量的方法,发现PEFT显著优于提示工程,且学生反馈认为其效果与ChatGPT相当,但需增加技术术语解释以提升教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12944 2026-05-14 cs.LG cs.CL 73%

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

从实例选择到固定池数据配方搜索用于监督微调

Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出固定池数据配方搜索方法,通过结合过滤、混合和去重操作,高效生成高质量监督微调数据集,实验显示其优于全数据训练和随机搜索等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00029 2026-05-14 cs.LG cs.AI 73%

LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing

LoRA-Mixer:通过序列注意力路由协调模块化LoRA专家

Wenbing Li, Zikai Song, Hang Zhou, Yunyao Zhang, Junqing Yu, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LoRA-Mixer通过将任务特定的LoRA专家路由到注意力模块的核心投影矩阵中,实现细粒度的token级专业化,同时保持与Transformer和状态空间模型的兼容性,且在15个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12789 2026-05-14 cs.RO 71%

Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention

视觉-语言模型的终身学习:增强的EWC与跨模态知识保留

Hamza Ahmed Durrani, Rafay Suleman Durrani

机构 * Sejong University, Computer Science Engineering(世宗大学,计算机科学工程) Technische Universität Ilmenau, Computer Engineering(伊门瑙技术大学,计算机工程)

专题命中 指令微调 :language model(title)

AI总结 本文提出一种结合增强EWC与参数高效微调的框架,有效减少视觉-语言模型在连续学习中的遗忘,通过多模态Fisher信息矩阵计算和跨模态一致性保留,实现78%的遗忘率降低,并在动态环境中提升多模态AI系统的适应能力。

Comments 8 pages, 5 figures, 1 table. Applications in autonomous driving, intelligent robotic assistants, and adaptive robotics systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13501 2026-05-14 cs.AR cs.LG 70%

Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation

基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成

Qingyun Zou, Yingze Li, Tianen Liu, Bingsheng He, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12752 2026-05-14 cs.LG 70%

Low-Rank Adapters Initialization via Gradient Surgery for Continual Learning

通过梯度手术实现低秩适配器初始化用于持续学习

Joana Pasquali, Ramiro N. Barros, Arthur S. Bianchessi, Vinícius Conte Turani, João Vitor Boer Abitante, Rafaela Cappelari Ravazio, Christian Mattjie, Otávio Parraga, Lucas S. Kupssinskü, Rodrigo C. Barros

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS, Porto Alegre, Brazil(马尔塔机器学习理论与应用实验室,PUCRS,巴西波尔图阿莱格雷)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SLICE方法,通过梯度手术优化LoRA适配器初始化,提升持续学习中稳定性与可塑性的平衡,改进性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏