Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
机构
*
Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada
;
School of Basic Medical Sciences, Hebei University, Baoding 071000, China
;
Department of Civil \& Environmental Engineering
;
School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?
Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang
机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Zhongguancun Academy(中关村科学城)
;
School of Engineering, Westlake University(西湖大学工学院)
;
School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
机构
*
National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院多光谱信息智能处理技术国家重点实验室)
;
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs
用指南引导的多模态语言模型增强可解释的心脏诊断
Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong
机构
*
Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学)
;
A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学)
;
VNPT AI, VNPT Group(VNPT人工智能,VNPT集团)
;
FPT University(FPT大学)
;
Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)
MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer
MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer
Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang
机构
*
Zhejiang University(浙江大学)
;
State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)
;
vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
;
vivo BlueImage Lab(vivo蓝图像实验室)