机构
*
Sun Yat-sen University(中山大学)
;
Shandong Normal University(山东师范大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Southeast University(东南大学)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
AdaMMS: 为异构多模态大语言模型设计的模型融合方法
Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)
;
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
;
State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
;
School of Software Microelectronics, Peking University(软件微电子学院,北京大学)
;
Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
;
Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)
;
ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)
机构
*
State Key Laboratory of Physical Oceanography and the Faculty of Information Science and Engineering, Ocean University of China(物理海洋学国家重点实验室和中国海洋大学信息科学与工程学院)
;
School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen university(中山大学深圳校区计算机科学与技术学院)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che
机构
*
Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Central South University(中南大学)
;
Fudan University(复旦大学)
;
The University of Hong Kong(香港大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心)
;
Guizhou University(贵州大学)
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应
Taha Koleilat, Hassan Rivaz, Yiming Xiao
机构
*
Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系)
;
Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)