Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning
步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法
Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室)
;
XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Data Science, Fudan University(复旦大学数据科学学院)
Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning
用于LoRA微调的Stiefel流形上无回缩优化
Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen
机构
*
Center for Data Science, Peking University(北京大学数据科学中心)
;
Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心)
;
Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心)
;
Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系)
;
Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
用自然语言自动编码器探究Qwen2.5 - 7B中潜在的哥伦比亚身份推断
Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino, Jhoan Stevan Mosquera Ortiz, Nicolás Lozano Mazuera, Gilber Alexis Corrales Gallego
机构
*
Universidad Autónoma de Occidente(西自治大学)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling
SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应
Yupeng Chang, Yuan Wu, Yi Chang
机构
*
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
;
Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心)
;
International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning
用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习
Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu
机构
*
The University of British Columbia(英属哥伦比亚大学)
;
Fudan University(复旦大学)
;
Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院)
;
Dyson School of Design Engineering(戴森设计工程学院)
;
Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所)
;
East China Normal University(华东师范大学)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs
PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解
Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou
机构
*
College of Future Information Technology, Fudan University(复旦大学未来信息技术学院)
;
Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部)
;
Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系)
;
Ant Group(蚂蚁集团)
;
College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
;
School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)
;
College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司)
;
Xiaomi EV, Xiaomi Campus(小米汽车、小米园区)
;
Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群)
;
College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)
;
School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG