机构
*
Sun Yat-sen University(中山大学)
;
Shandong Normal University(山东师范大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Southeast University(东南大学)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
AdaMMS: 为异构多模态大语言模型设计的模型融合方法
Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)
;
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
;
State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)
;
School of Software Microelectronics, Peking University(软件微电子学院,北京大学)
;
Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
;
Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)
;
ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)
机构
*
State Key Laboratory of Physical Oceanography and the Faculty of Information Science and Engineering, Ocean University of China(物理海洋学国家重点实验室和中国海洋大学信息科学与工程学院)
;
School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen university(中山大学深圳校区计算机科学与技术学院)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che
机构
*
Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Central South University(中南大学)
;
Fudan University(复旦大学)
;
The University of Hong Kong(香港大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心)
;
Guizhou University(贵州大学)
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应
Taha Koleilat, Hassan Rivaz, Yiming Xiao
机构
*
Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系)
;
Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)
A multimodal and temporal foundation model for virtual patient representations at healthcare system scale
面向医疗系统规模的多模态与时间基础模型:虚拟患者表示
Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood
机构
*
Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院)
;
Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所)
;
Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所)
;
Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工)
;
Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学)
;
Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院)
;
Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT))
;
School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)
Zeitgeist-Aware Multimodal (ZAM) Datasets of Pro-Eating Disorder Short-Form Videos: An Idea Worth Researching
具有时间意识的多模态(ZAM)数据集:关于促进进食障碍短视频的研究想法
Eden Shaveet, Zefan Sramek, Yumi Hamamoto, Jing Du, Scott Griffiths, Thalia Zhang, Thalia Viranda, William Hornby, Flora Salim, Koji Yatani, Tanzeem Choudhury
ExoNet: Calibrated Multimodal Deep Learning for TESS Exoplanet Candidate Vetting using Phase-Folded Light Curves, Stellar Parameters, and Multi-Head Attention
机构
*
Interdisciplinary Program in Artificial Intelligence(人工智能交叉学科项目)
;
Department of Intelligence and Information(智能与信息系)
;
Samsung Advanced Institute of Technology(三星先进技术研究院)
VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation
VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强
Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li, Yufei Liu
机构
*
Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司)
;
Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学)
;
School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)
机构
*
University of Central Florida(中央佛罗里达大学)
;
Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔)
;
Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)
机构
*
Beijing Electronic Science and Technology Institute(北京电子科技研究所)
;
Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))
;
Nanyang Technological University(南洋理工大学)
;
Nanjing University(南京大学)
;
School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)