机构
*
School of iOPEN, Northwestern Polytechnical University(iOPEN学院,西北工业大学)
;
The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院)
;
College of Mechanical Engineering, Tongji University(同济大学机械工程学院)
Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?
用于遥感图像理解的多模态大语言模型:领域特定还是通用?
Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li
机构
*
School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
;
Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室)
;
Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments4 pages, 2 figures, accepted and to be presented at 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026), scheduled for 9 to 14 August 2026 in Washington D.C
Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging
自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型
Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin
机构
*
UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目)
;
Department of Radiology, UCSF(UCSF放射科)
;
Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型
Kinhei Lee, Peiyuan Jing, Zhenxuan Zhang, Yue Yang, Tao Wang, Dominic C Marshall, Yingying Fang, Guang Yang
机构
*
Bioengineering Department and Imperial-X(生物工程系和Imperial-X)
;
Imperial College London(帝国理工学院伦敦分校)
;
College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院)
;
Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校)
;
National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校)
;
Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院)
;
School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)
专题命中
视觉问答
:vision language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.AI
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
MEGC2026:面向视觉问答的微表情大奖挑战
Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison
机构
*
Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系)
;
State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系)
;
School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)
专题命中
视觉问答
:visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
Hallucination Filtering in Radiology Vision-Language Models Using Discrete Semantic Entropy
在放射学视觉-语言模型中使用离散语义熵过滤幻觉
Patrick Wienholt, Sophie Caselitz, Robert Siepmann, Philipp Bruners, Keno Bressem, Christiane Kuhl, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn
机构
*
Lab for Artificial Intelligence in Medicine, Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(医学人工智能实验室,诊断与介入放射学部,RWTH亚琛大学医院)
;
Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(诊断与介入放射学部,RWTH亚琛大学医院)
;
Department of Diagnostic and Interventional Radiology, Technical University of Munich, School of Medicine and Health, Klinikum rechts der Isar, TUM University Hospital(诊断与介入放射学部,慕尼黑技术大学,医学院与健康学院,Klinikum rechts der Isar,TUM大学医院)
;
Department of Cardiovascular Radiology and Nuclear Medicine, Technical University of Munich, School of Medicine and Health, German Heart Center, TUM University Hospital(心血管放射学与核医学部,慕尼黑技术大学,医学院与健康学院,德国心脏中心,TUM大学医院)
;
Else Kroener Fresenius Center for Digital Health, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(数字健康中心,医学院与卡尔·古斯塔夫·卡尔斯大学医院,德累斯顿技术大学)
;
Department of Medicine I, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(第一医学部,医学院与卡尔·古斯塔夫·卡尔斯大学医院,德累斯顿技术大学)
;
Pathology & Data Analytics, Leeds Institute of Medical Research at St James’s, University of Leeds(病理学与数据分析,圣詹姆斯医院医学研究所,利兹大学)
;
Medical Oncology, National Center for Tumor Diseases (NCT), University Hospital Heidelberg(医学肿瘤学,国家肿瘤疾病中心(NCT),海德堡大学医院)
机构
*
State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Aerospace Information Research Institute(航天信息研究所)
;
Chinese Academy of Sciences(中国科学院)
;
School of Geographical Sciences(地理科学学院)
;
Hunan Normal University(湖南师范大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
Jiahe Qian, Yuhao Shen, Zhangtianyi Chen, Juexiao Zhou, Peisong Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港大学深圳研究院数据科学学院)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem
机构
*
Technical University of Munich (TUM)(慕尼黑技术大学)
;
TUM University Hospital(慕尼黑技术大学医院)
;
German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心)
;
Department of Radiology(放射科)
;
Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所)
;
Uniklinik RWTH Aachen(亚琛工业大学医院)
;
HOPPR IL USA(HOPPR美国)
;
University of Oxford(牛津大学)
;
Imperial College London(伦敦帝国学院)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
Mai A. Shaaban, Tausifa Jan Saleem, Vijay Ram Papineni, Mohammad Yaqub
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Department of Mathematics and Computer Science, Faculty of Science, Alexandria University(亚历山大大学数学与计算机科学系)
;
Sheikh Shakhbout Medical City(谢赫·沙赫布OUT医疗城)
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Wen-Huang Cheng, Xiaobai Li, Xiaopeng Hong, Su-Jing Wang, Adrian K. Davision
机构
*
Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系,曼彻斯特 Metropolitan 大学)
;
State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, Chinese Academy of Sciences(认知科学与心理健康国家重点实验室,心理学研究所,中国科学院)
;
Department of Psychology, University of the Chinese Academy of Sciences(心理学系,中国科学院大学)
;
National Taiwan University(台湾大学)
;
Zhejiang University(浙江大学)
;
University of Oulu(奥卢大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉问答
:visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
CommentsMicro-Expression Grand Challenge (MEGC) at ACM MM 2025