CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations
CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距
Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Beijing Anzhen Hospital(北京安贞医院)
;
Beihang University(北航)
;
King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Disentanglement-Based Equivariant Learning for Compositional VQA
基于解耦的等变学习用于组合式VQA
Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu
机构
*
IEEE Publication Technology Group(IEEE出版技术组)
;
School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)
;
Engineering Research Center of Sustainable Urban Intelligence Transportation, Ministry of Education, China(可持续智慧城市交通工程研究中心,中华人民共和国教育部)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统(MAIS)国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA
基于结构化视觉证据的时间证据路由用于TimeLogicQA
Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang
机构
*
Southeast University(东南大学)
;
National University of Singapore(新加坡国立大学)
;
Independent Researcher(独立研究员)
;
Opus AI Research(Opus AI研究院)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV
Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA
Ask4VG: 用于减少医学VQA中先验驱动答案的风险感知问题选择
Xiaorong Zhu, Qiang Li, Zibo Xu, Weijie Wang, Weizhi Nie
机构
*
School of Microelectronics, Tianjin University, Tianjin 300072, China(天津大学电子工程学院,天津 300072,中国)
;
DISI, University of Trento, Trento, Italy(特伦托大学DISI研究所,意大利特伦托)
;
School of Electrical and Information Engineering, Tianjin University, Tianjin 300072, China(天津大学电气与信息工程学院,天津 300072,中国)
机构
*
School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学)
;
Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE) Lab, YRD-RIGHT, USTC Suzhou Institute for Advanced Research(医学影像、机器人、分析计算与学习(MIRACLE)实验室,YRD-RIGHT,中国科学技术大学苏州研究院)
;
Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室)
;
Biomedical Basic Research Center (BBRC) of Jiangsu Province(江苏省生物医学基础研究中心)
;
Department of Radiology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(放射科,中国科学技术大学第一附属医院,生命科学与医学系,中国科学技术大学)
;
Anhui IFLYTEK CO., Ltd(安徽科大讯飞股份有限公司)
;
School of Medicine, Stanford University(医学院,斯坦福大学)
;
State Key Laboratory of Precision and Intelligent Chemistry, Hefei, Anhui, China(安徽省精密与智能化学重点实验室,合肥,安徽,中国)
Dual-Route Top-K Retrieval with 1v1 VLM Reranking for the CoVR-R
双路Top-K检索与1v1 VLM重排序用于CoVR-R
Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang
机构
*
Southeast University(东南大学)
;
National University of Singapore(新加坡国立大学)
;
Independent Researcher(独立研究者)
;
Opus AI Research(Opus AI研究)
;
University of Science and Technology of China(中国科学技术大学)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
LookWise: 知道何时何地关注多模态大语言模型中的细粒度视觉推理
Yuxiang Shen, Hailong Huang, Zhenkun Gao, Xueheng Li, Man Zhou, Chengjun Xie, Haoxuan Che, Xuanhua He, Jie Zhang
机构
*
Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhejiang University(浙江大学)
;
East China Normal University(华东师范大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
机构
*
Tandon School of Engineering, New York University(纽约大学工程学院)
;
Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院)
;
Brookhaven National Laboratory(布鲁克海文国家实验室)