Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
CommentsAccepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li
机构
*
School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
;
Tencent Jarvis Lab(腾讯Jarvis实验室)
;
University of Cambridge(剑桥大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型
Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed
机构
*
Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学)
;
Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
MedObvious:通过临床分诊暴露视觉语言模型中的医学莫拉维奇悖论
Ufaq Khan, Umair Nawaz, L D M S S Teja, Numaan Saeed, Muhammad Bilal, Yutong Xie, Mohammad Yaqub, Muhammad Haris Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence, UAE(马尔代夫布扎伊德人工智能大学,阿联酋)
;
National Institute of Technology, Silchar(西尔CHAR国家理工学院)
;
Birmingham City University, UK(伯明翰城市大学,英国)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner
Patho-R1: 基于多模态强化学习的病理专家推理器
Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu
机构
*
Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门)
;
Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所)
;
University of Toronto(多伦多大学)
;
Business School, Sichuan University(四川大学商学院)
;
Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
M4-RAG:大规模多语言多文化多模态检索增强生成
David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata
机构
*
Stanford University(斯坦福大学)
;
MBZUAI
;
Indian Institute of Science(印度科学研究院)
;
Ontario Tech University(安大略技术大学)
;
University of Toronto(多伦多大学)
;
Capital One
AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
AQuA:迈向具有模糊性视觉问题的策略性响应生成
Jihyoung Jang, Hyounghun Kim
机构
*
Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH)
;
Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)