SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践
机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Tianjin University(天津大学) ; Hong Kong University of Science and Technology(香港科学大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract)
AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。
Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)