arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 32 篇

2606.06350 2026-06-05 cs.CL 92%

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

EDIT:基于证据诊断的干预训练以实现遵循规则的LLM评分

Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

机构 * King’s College London(伦敦国王学院) University of Cambridge(剑桥大学) AQA The Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出EDIT框架,通过内部模型信号定位推理错误步骤并修正,结合信念引导的奖励塑造,提升LLM评分对评分标准的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05523 2026-06-05 cs.CL 92%

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

CHASE:利用强化学习进行对抗性红蓝队训练以提高LLM安全性

Rahul Markasserithodi, Aditya Joshi, Yuekang Li, Ishmanbir Singh, Chris Yoo, Alan Niu

机构 * University of New South Wales(新南威尔士大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.CL

AI总结 提出CHASE框架,通过红蓝队协同进化(红队使用GRPO生成对抗性改写,蓝队使用两阶段GRPO+拒绝采样SFT进行防御),在保持良性提示零误拒的同时将攻击成功率降低43.2%。

Comments Under Review at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03086 2026-06-05 cs.PL cs.AI cs.SE 92%

Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation

超越代码对:基于对话的数据生成用于LLM代码翻译

Le Chen, Nuo Xu, Winson Chen, Bin Lei, Pei-Hung Lin, Dunzhi Zhou, Rajeev Thakur, Caiwen Ding, Ali Jannesari, Chunhua Liao

机构 * Argonne National Laboratory(阿贡国家实验室) University of Minnesota(明尼苏达大学) Iowa State University(爱荷华州立大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于对话的数据生成方法,通过双LLM架构生成验证的翻译和多轮对话,以提升LLM在低资源编程领域中的代码翻译能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06063 2026-06-05 cs.DC 89%

LLM-Based Porting of Optimized C++ to CUDA Through Deoptimization and Reoptimization

基于LLM的通过去优化和再优化将优化C++移植到CUDA

Daichi Mukunoki, Ryo Mikasa, Shunichiro Hayashi, Tetsuya Hoshino, Takahiro Katagiri

专题命中 指令微调 :LLM(title,title_cn)

AI总结 提出Deopt-Reopt工作流,通过先简化CPU优化代码再重新翻译优化为CUDA,利用LLM提升移植性能,实验表明该方法在部分内核上有效但非普遍适用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05937 2026-06-05 cs.CL 89%

Large Language Models are Perplexed by some Political Parties

大型语言模型对某些政党感到困惑

Paul Lerner, François Yvon

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、信息研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 通过困惑度评估,发现大型语言模型对极右翼和民族主义政党文本的困惑度高于社会民主党,且该偏差源于预训练阶段,指令微调影响甚微。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06244 2026-06-05 cs.CR 88%

Steering LLM Viewpoints through Fabricated Evidence Injection

通过捏造证据注入操控LLM观点

Xi Yang, Chang Liu, Zhenglin Huang, Haoran Li, Weiming Zhang, Jian Weng, Yangqiu Song

专题命中 指令微调 :LLM(title,title_cn)

AI总结 提出Ghostwriter两阶段攻击框架,通过注入带有可信标记的捏造证据,利用LLM对外部上下文的盲目信任来操控其观点,并探索防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06306 2026-06-05 cs.CL 88%

Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

分解语言模型中的事实性谄媚:规模与指令调优如何塑造鲁棒性

Victor De Marez, Luna De Bruyne, Walter Daelemans

机构 * Centre for Computational Linguistics, Psycholinguistics and Sociolinguistics University of Antwerp(计算语言学、心理语言学与社会语言学研究中心 荷兰安特卫普大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL

AI总结 通过将事实性谄媚分解为真值边际和操纵敏感性两个通道,研究了模型规模和指令调优对56个开源语言模型(0.3B-32B参数)在13种操纵类型下鲁棒性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29219 2026-06-05 cs.CV 87%

SalsaAgent: A multimodal embodied language model for interactive dance generation

SalsaAgent: 一种用于交互式舞蹈生成的多模态具身语言模型

Payam Jome Yazdian, Zoe Stanley, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出SalsaAgent语言模型,通过非语言运动令牌传递和两阶段令牌到扩散管道,生成与人类领舞者及音乐背景交互的全身萨尔萨舞蹈动作。

Comments Project page: https://pjyazdian.github.io/Salsa-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20158 2026-06-05 cs.CV 87%

Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

在安全对齐的连续视觉指令微调中实现和谐参数适应

Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06249 2026-06-05 cs.LG cs.AI 86%

In-Training Defenses against Emergent Misalignment in Language Models

训练过程中对抗语言模型中新兴偏差的防御措施

David Kaczér, Magnus Jørgenvåg, Clemens Vetter, Esha Afzal, Robin Haselhorst, Lucie Flek, Florian Mai

机构 * University of Copenhagen(哥本哈根大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练过程中如何防止语言模型出现新兴偏差,提出了五种训练正则化干预方法,并展示了通过选择对齐模型与偏差模型之间困惑度差异的交错数据可以获得最佳效果。

Comments Accepted at ICML 2026 https://icml.cc/virtual/2026/poster/64303

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19190 2026-06-05 cs.CV cs.AI 85%

FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery

FUSAR-GPT : 一种嵌入时空特征和两阶段解耦的视觉语言模型,用于合成孔径雷达图像

Xiaokun Zhang, Yi Yang, Ziqi Ye, Baiyun, Xiaorong Guo, Qingchen Fang, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Discipline and Technology Center of Microwave Vision Intelligent Sensing, Fudan University(微波视觉智能感知学科与技术中心,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FUSAR-GPT,一种专门针对合成孔径雷达图像的视觉语言模型,通过嵌入时空特征和两阶段解耦方法,在多个遥感视觉语言基准测试中实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12124 2026-06-05 cs.LG cs.CL 85%

Alignment Risks from Capability-Seeking RL Training

从能力寻求强化学习训练中产生的对齐风险

Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05395 2026-06-05 cs.RO cs.AI 84%

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO:物理AI智能体的形式可验证自进化技能

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Iowa State University(爱荷华州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出VASO框架,通过形式验证引导LLM生成的机器人技能合约自进化,将模型检查的反例转化为文本梯度更新技能合约,无需微调模型权重,在Jackal和四旋翼任务中达到97.2%的形式规范符合率。

Comments Project webpage: https://languagegroundedriskdetection.github.io/ProjectPage/vaso-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05758 2026-06-05 cs.CV cs.AI cs.LG 84%

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器

Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21338 2026-06-05 cs.LG 83%

Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models

掩码可能具有干扰性:关于扩散语言模型中的上下文理解

Julianna Piskorz, Cristina Pinneri, Alvaro Correia, Motasem Alfarra, Risheek Garrepalli, Christos Louizos

机构 * University of Cambridge(剑桥大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中掩码对上下文理解的影响,发现掩码会干扰模型对相关信息的处理,提出一种掩码无关的损失函数以提高模型的鲁棒性。

Comments Published at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05713 2026-06-05 cs.MM cs.SD eess.AS 82%

Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

超越生成式解码:来自原生全模态大语言模型的判别性隐藏状态读出用于多模态情感分析

Bin Wen, Tien-Ping Tan

机构 * School of Computer Sciences, Universiti Sains Malaysia, Penang, Malaysia(计算机科学学院,马来西亚国际科学大学,槟城)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract)

AI总结 针对多模态情感分析中生成式读出将连续回归绑定到离散自回归解码导致精度和效率损失的问题,提出基于原生全模态大语言模型Qwen2.5-Omni-7B的Thinker模块的判别性读出方法,通过轻量回归头直接映射最终层隐藏状态,在单消费级GPU上实现最先进性能。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26761 2026-06-05 cs.CV 82%

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning

Once-For-All: 一种用于多模态指令微调的“一次训练,随时选择”框架

Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract)

AI总结 提出OFA框架,通过一次训练可迁移的选择器,无需重新计算即可从任意数据集或模型中筛选出最具信息量的多模态指令数据,实现高效微调。

Comments 15 pages, 6 figures. Mingkang Dong and Hongyi Cai contributed equally to this work. Muxin Pu is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05958 2026-06-05 cs.LG 81%

Steering Vectors are an Adversarial Attack Surface

Steering Vectors 是对抗攻击面

Abzal Aidakhmetov, Donato Crisostomi, Tommaso Mencattini, Adrian Robert Minut, Iacopo Masi, Emanuele Rodolà

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) EPFL(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文揭示了一种隐蔽的数据投毒攻击,通过替换转向数据集中的4-6%令牌,使转向向量与反拒绝方向对齐,从而劫持目标模型,同时保留对良性提示的预期转向效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05516 2026-06-05 cs.LG 81%

Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs

主导层 ZO:单层主导大语言模型的零阶微调

Wanhao Yu, Ziyan Wang, Zheng Wang, Abeer Matar Almalky, Yihang Zuo, Shuteng Niu, Sen Lin, Adnan Siraj Rakin, Deliang Fan, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Houston(休斯顿大学) State University of New York at Binghamton(纽约州立大学布法罗分校) Arizona State University(亚利桑那州立大学) Department of Artificial Intelligence and Informatics, Mayo Clinic(梅奥诊所人工智能与信息学系)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文发现零阶优化微调大语言模型时,单个解码层主导性能,通过仅微调该层可匹配或超越全模型微调,并基于激活异常值识别该层,解释其机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05396 2026-06-05 cs.CR cs.AI cs.SE 81%

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

有意但无力:通过消融分离代码大语言模型中的拒绝与能力

Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Coimbra(科英布拉大学) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文通过消融技术(abliteration)对代码LLM进行低秩权重编辑,以消除其对安全注入提示的拒绝行为,从而分离拒绝意愿与代码生成能力,实验表明消融后拒绝率降至零而语法有效性保持93%以上,但注入率仍受模型容量限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19568 2026-06-05 cs.AI cs.SE 81%

Learning Adaptive Parallel Execution for Efficient Code Localization

学习适应性并行执行以实现高效的代码定位

Ke Xu, Siyang Xiao, Ming Liang, Yichen Yu, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 本文提出FuseSearch,通过将并行代码定位重新表述为联合质量-效率优化任务,采用两阶段SFT和RL训练方法学习适应性并行策略,以提高代码定位的效率和性能。

Comments Paper accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06492 2026-06-05 cs.SE cs.AI cs.CL 81%

Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution

Code2LoRA:用于软件演化下代码语言模型的超网络生成适配器

Liliana Hotsko, Yinxi Li, Yuntian Deng, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Code2LoRA超网络框架,通过生成仓库特定的LoRA适配器注入仓库知识,无需推理时令牌开销,支持静态和演化两种场景,在RepoPeftBench上达到与逐仓库LoRA相当或更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13697 2026-06-05 cs.AI cs.DB cs.LG 81%

No Need to Train Your RDB Foundation Model

无需训练你的关系数据库基础模型

Linjie Xu, Yanlin Zhang, Quan Gan, Minjie Wang, David Wipf

机构 * University of Hong Kong, Shanghai X-Lab(香港大学,上海X实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文学习的关系数据库编码器,能够在不重新训练的情况下,与现有的单表上下文学习基础模型结合,实现对多张相关表的高效处理。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06154 2026-06-05 cs.AI 80%

Amortizing Federated Adaptation: Hypernetwork Driven LoRA for Personalized Foundation Models

摊销联邦自适应:基于超网络的LoRA用于个性化基础模型

Sunny Gupta, Shambhavi Shanker, Amit Sethi

机构 * Indian Institute of Technology, Bombay(印度理工学院班加罗尔)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 提出HyperLoRA框架,通过超网络驱动的LoRA生成和乘积空间聚合,解决联邦LoRA中的结构聚合偏差和客户端初始化滞后问题,实现高效个性化、无偏聚合和更快收敛。

Comments Accepted at International Workshop on Federated Learning in the Age of Foundation Models In Conjunction with IJCAI 2026 (FL@FM-IJCAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11042 2026-06-05 cs.LG 79%

GenFT: A Generative Parameter-Efficient Fine-Tuning Method for Pretrained Foundation Models

GenFT:一种用于预训练基础模型的生成性参数高效微调方法

Guangning Xu, Baoquan Zhang, Michael. K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University, Hong Kong, China(香港 Baptist 大学数学系,香港,中国) Department of Computer Science, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)计算机科学系,中国)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出GenFT,一种基于预训练权重的参数高效微调方法,通过生成任务特定的更新来利用预训练权重中的结构信息,实现高效的模型微调。

Comments paper is accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06239 2026-06-05 eess.SP 78%

Foundation Models for Wireless Communications: From PHY Intelligence to Network Autonomy

无线通信的基础模型:从物理层智能到网络自治

Le Liang, Jiajia Guo, Jun Zhang, Chan-Byoung Chae, Lu Lu, Shugong Xu, Octavia A. Dobre, Shi Jin, Geoffrey Ye Li

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文综述了基础模型在无线通信中的应用,从适配预训练模型、构建无线原生模型到智能体模型,推动物理层处理和资源管理向网络自治演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05613 2026-06-05 cs.AI 77%

Multilingual Fine-Tuning via Localized Gradient Conflict Resolution

通过局部梯度冲突解决的多语言微调

Long P. Hoang, Yiran Zhao, Wei Lu, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Bucket-Level MOO框架,将多语言微调重构为多目标优化问题,通过局部梯度冲突解决提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06428 2026-06-05 cs.CL 70%

Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

强化学习引发对未见语言的上下文翻译学习

Hanxu Hu, Zdeněk Šnajdr, Pinzhen Chen, Jannis Vamvas, Rico Sennrich

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出使用强化学习(RL)方法,以chrF为奖励,使大语言模型从丰富的语言上下文中提取并应用语言学知识,实现对完全未见语言的有效翻译。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00573 2026-06-05 cs.CL 70%

CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging

CoMoL: 通过动态核心空间融合实现高效的LoRA专家混合

Jie Cao, Zhenxuan Fan, Zhuonan Wang, Tianwei Lin, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao, Siliang Tang

机构 * Zhejiang University(浙江大学) Wechat, Tencent(微信,腾讯)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CoMoL,一种新的MoE-LoRA框架,通过引入核心空间专家和核心空间路由,实现参数高效和细粒度适应,同时在多个任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12628 2026-06-05 cs.RO 67%

Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models

超越模仿:基于强化学习的仿真-现实协同训练用于VLA模型

Liangzhi Shi, Shuaihang Chen, Feng Gao, Yinuo Chen, Kang Chen, Tonghe Zhang, Hongzhi Zang, Jiakai Zhou, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出基于强化学习的仿真-现实协同训练框架,通过结合仿真交互与真实世界数据,提升VLA模型的现实应用能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏