MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解
Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang
机构
*
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
Southern University of Science and Technology(南方科技大学)
;
TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)
;
MM Lab, CUHK(CUHK 多模态实验室)
;
RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Lingnan University(岭南大学)
;
The Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital Yunnan(昆明医科大学第三附属医院、云南癌症医院、北京大学肿瘤医院云南分院)
;
Guangzhou First People's Hospital, South China University of Technology(广州第一人民医院、华南理工大学)
;
The Third Affiliated Hospital, Sun Yat-Sen University(中山大学第三附属医院)
;
HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)
UniMedVL: Unifying Medical Multimodal Understanding and Generation through Observation-Knowledge-Analysis
UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成
Junzhi Ning, Wei Li, Cheng Tang, Jiashi Lin, Chenglong Ma, Chaoyang Zhang, Jiyao Liu, Ying Chen, Shujian Gao, Yuandong Pu, Huihui Xu, Chenhui Gou, Ziyan Huang, Yi Xin, Qi Qin, Diping Song, Bin Fu, Guang Yang, Yuanfeng Ji, Tianbin Li, Yanzhou Su, Jin Ye, Shixiang Tang, Zhongying Deng, Lihao Liu, Ming Hu, Junjun He
机构
*
Shanghai Artificial Intelligence Laboratory
;
Shanghai Innovation Institute
;
Shanghai Jiao Tong University
;
Shanghai Institute of Optics
;
Fudan University
;
University of Cambridge
;
Monash University
;
DAMO Academy, Alibaba Group
;
Imperial College London
;
The University of Hong Kong
;
The Hong Kong University of Science
;
Hupan Lab
;
The Chinese University of Hong Kong
机构
*
Arizona State University(亚利桑那州立大学)
;
Clemson University(克莱姆森大学)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
University of Notre Dame(诺特丹大学)
;
Florida State University(佛罗里达州立大学)
;
Rice University(里德大学)
;
NVIDIA(英伟达)
;
Mayo Clinic(梅奥诊所)
A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning
基于语言和声学表征学习的多模态痴呆检测框架
Loukas Ilias, Dimitris Askounis
机构
*
Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(决策支持系统实验室,电气与计算机工程学院,国家技术大学雅典)
机构
*
Department of Data Science \& AI, Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia Alfred Health Radiology, Alfred Health, Melbourne, VIC 3004, Australia School of Translational Medicine, Faculty of Medicine, Nursing
;
Health Sciences, Monash University, Melbourne, VIC 3800, Australia Hong Kong Polytechnic University, Hong Kong SAR, China
CommentsEarly accepted by MICCAI 2026. This version of the contribution has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections
Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models
通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型
Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer
机构
*
University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院)
;
Kobe University(Kobe大学)
;
ETH AI Center(苏黎世联邦理工学院人工智能中心)
;
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Zurich University of Applied Sciences(苏黎世应用科学大学)
机构
*
School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)
;
Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)
;
School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)
机构
*
Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序)
;
TU Munich, Germany(慕尼黑工业大学,德国)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
Munich, Germany(慕尼黑,德国)
;
Zhongshan Hospital, Fudan University, China(复旦大学中山医院)
;
The University of Hong Kong, Hongkong, China(香港大学,香港,中国)
MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
MedFM-Robust:医学基础模型的鲁棒性基准测试
Xiangxiang Cui, Tianjin Huang, Yifang Wang, Lijie Hu, Lu Yin
机构
*
Beijing Normal University, China(北京师范大学)
;
University of Exeter, United Kingdom(埃克塞特大学)
;
University College London, United Kingdom(伦敦大学学院)
;
Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学)
;
University of Surrey, United Kingdom(萨里大学)
Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
迈向具有空间定位病变证据的临床可解释性眼科VQA
Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu
机构
*
Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)
;
The Hong Kong Polytechnic University(香港理工大学)
;
National University of Singapore(新加坡国立大学)
;
University of Washington(华盛顿大学)
;
Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)
RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
RoiMAM:面向高效视觉-语言理解的感兴趣区域医学注意模型
Jiayan Yang, Zhuoyu Wu, Wenqi Fang
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
;
CyPhi( ) AI Research Lab, School of IT, Monash University, Malaysia Campus(CyPhi人工智能研究实验室,信息学院,墨尔本大学马来西亚校区)
CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis
CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法
Haroon Wahab, Irfan Mehmood, Hassan Ugail
机构
*
School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院)
;
School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院)
;
Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)
CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation
CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读
Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz
机构
*
Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心)
;
Department of Radiology(放射科)
;
Department of Pediatrics(儿科)
;
Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科)
;
Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of California, San Francisco(加州大学旧金山分校)
;
Department of Biomedical Data Science(生物医学数据科学部)
Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA
双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答
Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su
机构
*
School of Microelectronics, Tianjin University(天津大学微电子学院)
;
Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部)
;
Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室)
;
School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应
Taha Koleilat, Hassan Rivaz, Yiming Xiao
机构
*
Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系)
;
Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)
REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction
REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测
Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang
机构
*
J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系)
;
Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所)
;
Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系)
;
Department of Computer Science, Stony Brook University(石溪大学计算机科学系)