M*: A Modular, Extensible, Serving System for Multimodal Models
M*: 一个模块化、可扩展的多模态模型服务系统
Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang
机构
*
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
Carnegie Mellon University(卡内基梅隆大学)
On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning
面向音视频广义零样本学习的层次化标准化嵌入对齐
Zihan Zhang, Jie Hong, Siyuan Fan, Yanghao Zhou, Pengfei Fang
机构
*
Southeast University(东南大学)
;
The University of Hong Kong(香港大学)
;
Beijing Institute of Technology(北京理工大学)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部)
;
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
机构
*
Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada
;
School of Basic Medical Sciences, Hebei University, Baoding 071000, China
;
Department of Civil \& Environmental Engineering
;
School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
CommentsSubmitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)
机构
*
eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心)
;
MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB)
;
Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))
Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)